微软与伊利诺伊大学提出 StudentSim:用模拟学生帮 AI 导师更快学习
微软与伊利诺伊大学提出 StudentSim,用少量数据为每个学生构建数字复制体,替代真人提供快速反馈来训练 AI 导师。该系统以 Qwen3-4B-Instruct 为基座、分两阶段训练,在 chess、英语和数学三项测试中均优于被提示扮演学生的 GPT-5.4,在 chess 中预测下一步走法的准确率约为其两倍。
首页已经看过的不重复列。下面从更早的内容继续,可以一直往下滚。
微软与伊利诺伊大学提出 StudentSim,用少量数据为每个学生构建数字复制体,替代真人提供快速反馈来训练 AI 导师。该系统以 Qwen3-4B-Instruct 为基座、分两阶段训练,在 chess、英语和数学三项测试中均优于被提示扮演学生的 GPT-5.4,在 chess 中预测下一步走法的准确率约为其两倍。
如果在 Gemini 4.0 之前再出一个 Flash 模型,我不会感到意外。
据 AP 报道,四名订阅者起诉 Anthropic、OpenAI、Google 和 SpaceXAI,指控它们非法协调以减缓 AI 发展、降低其付费订阅的价值
所以我们已经看到以下模型的测试:
石化盈科与火山引擎合作全面引入 TRAE IDE,目前已开通 2000+ 座席、月消耗 1000 亿+ Tokens,深度嵌入需求分析、代码编写到测试交付的研发全流程
一汽-大众 ID. AURA T6 纯电 SUV 于 9 月 20 日上市,共四款车型,售价 12.99 万 - 16.69 万元。该车是大众首款搭载激光雷达的纯电 SUV,采用大众与地平线合资的"酷睿程"方案,地平线征程 6H 芯片算力 420TOPS,配备 192 线激光雷达。
有人把 xAI Grok Bot 团队三名工程师 72 小时从空仓库构建产品的直播经验,整理成 MIT 协议开源仓库 grokbot-field-notes。
StepFun 发布旗舰级多模态 MoE 模型 Step 5 Preview,并提供多重免费试用入口,可累计获得 75 天 Plus 版本订阅。
Anthropic 宣布与埃森哲合作,未来五年各自至少投入 10 亿美元对前沿模型开展独立评估。埃森哲旗下 Faculty 将主导评估与红蓝对抗测试,采用驻场评估模式,独立评估人员进驻企业内部并获得与普通员工基本相当的系统访问权限
Android 知名工程师 Jake Wharton 在访谈中解释了自己求职时把「不沾 AI」列为首要标准的原因,并算了一笔账:AI 编程工具目前靠风投补贴压低价格,一旦补贴退潮,LLM 生成代码的成本将高于被裁掉的工程师。
阶跃星辰上线面向智能体工作的旗舰模型 Step 5 Preview,600B 总参数 MoE、1M 上下文带视觉,主打低任务成本与长程执行。
广汽能源自营充电桩总数突破 3 万根,达 30,835 根,保有量跃居车企第一,其中自营超充桩 21,324 根、占比近七成。广汽已建成覆盖全国 31 个省级行政区、232 个市级行政区的补能网络,含自营充电站 2,471 座,合作充电桩 183 万根。其超充桩单枪最高充电功率达 800kW,设备在线率 99.2%。
Grok @Bot
自变量 QUANTA X1 Pro 轮式双臂机器人已在 Lululemon 武汉配送中心部署,该中心于 9 月 16 日正式启用,由 Lululemon 与 SFlogistic 合作建设,采用自动化设备与端到端 RFID 流程。QUANTA X1 Pro 在物流线上负责包裹搬运与整理,参与日常运营
面壁智能 OpenBMB 的本地模型 Augury 经调优后,植物照片识别 top-1 准确率从 71.8% 提升至 80.2%,通过合并重复物种键和加入 PCA 白化实现。该模型还修复了格式化器编造 pH 值的问题,将置信度阈值从 0.80 下调至 0.65,澳大利亚带土壤数据的物种从 188 增至 221
本期 AI 日报汇总八条动态:微信 AI 团队开源可执行知识库 WeKnora、智谱回应 ZCode 代码上传争议、ChatGPT 官方插件入驻 Word、阶跃星辰 Step5Preview 单任务成本降至 Claude Opus5 的 1/8、SpaceXAI 语音转写错误率减半、B 站上线 AI 竞技场测评榜、千问同传延迟降至 2.3
NVIDIA 提出一种前后端架构,让全双工语音模型通过发出委托 token,将流式转录转发给文本后端 LLM 执行工具调用,再经轻量 prefill-and-repeat 机制回传结果并由 TTS 播报。
Astra for Law 首批通过 Trusted Access 向部分律所开放,可在 ChatGPT 和 Codex 中使用,API 即将推出。
据 Notebookcheck 报道,英特尔暂停运行多年的漏洞赏金计划,转而在 Intigriti 平台启用新的负责任披露项目,不再提供现金奖励,此前最高赏金为 10 万美元。
原文引用安全研究人员用 Claude Opus 5 将漏洞扩展为 OpenAI 账户接管的案例。
3 名安全研究人员使用 Claude Opus 5 仅用几小时、Token 成本不到 3000 美元,将图片上传漏洞扩展为 OpenAI 员工账户接管,并通过 Codex 提交内部 PR。
特朗普在 Truth Social 宣布将组建仿照太空军的 AI Force,并计划任命一位 AI czar。他称 AI 可能占美国经济产出的 25%,对滥用行为将依赖现有刑民法律而非新增监管,同时将针对 AI 和数据中心的批评归为左翼攻击;此前 AI 实验室负责人和数学家曾警告按当前速度发展 AI 可能给人类带来生存风险。
推文仅包含优化代码链接和技术报告链接。
Claude 为 GPU 编写定制软件,优化了 30 多个开源生物分子模型的推理性能,平均运行速度提升 4 倍。
OpenAI 核心研究员 Noam Brown 披露万级智能体系统在 88 小时内攻克千禧年数学难题,并指出多智能体并行扩展、AI 递归自我改进与内外认知鸿沟正在加速奇点到来。
特斯拉澳新官方账号公布 FSD(监督版)上线一周年安全数据:2025 年 9 月 17 日至 2026 年 9 月 16 日,开启 FSD 行驶的 1.6 亿公里中平均每 178 万公里发生一次碰撞,人工驾驶的 24 亿公里中平均每 107 万公里一次,整体事故率低 40%。