Vals AI 用《我的世界》141 小时测试 GPT-6 Astra,发现 AI 受挫后陷入行为僵局
AI 评测机构 Vals AI 在 Twitch 直播中对 OpenAI 模型 GPT-6 Astra 进行了 141 小时的《我的世界》长时自主游戏测试
按来源浏览
AI 评测机构 Vals AI 在 Twitch 直播中对 OpenAI 模型 GPT-6 Astra 进行了 141 小时的《我的世界》长时自主游戏测试
AI 视频音频编辑平台 Descript 通过 OpenRouter 统一接入模型,把新模型评测从"两小时工程加一周等待"压缩到一两小时,团队现在每周多次评测模型。
贝索斯反驳AI将取代放射科医生和软件工程师的说法,认为AI会提升这些从业者的能力。他以挖地下室时有人递上推土机作比喻,称经济生产力将大幅提升,反而可能出现劳动力短缺。
一位产品负责人分享自己处理几乎所有问题都遵循的六步框架:理解已有信息、补齐缺失信息、定义问题、定义清晰简单的解法、定义目标、带着紧迫感行动,并在获得新信息后反复回到第 3-5 步。他认为最常见的失败模式是没能清晰定义问题、没能给出清晰简单的解法,并称"我喜欢犯错",因为犯错能帮助更快明确问题、找到正确解法。
日产 CEO 伊万・埃斯皮诺萨透露,第 14 代 Skyline(V38)轿车将于今年 12 月正式亮相,项目从立项到完成仅用 26 个月,比上一代 V37 的 55 个月缩短一半以上,得益于 AI 在设计、工程、测试和生产环节的广泛应用
Vals AI 用《我的世界》拷问 GPT-6 Astra 141 小时:炸掉一只箱子,AI 就缩进田里种土豆不出来了 · 1 · Sep 21, 2026 17 AI 评测机构 Vals AI 干了一件挺硬核的事:拿游戏《我的世界》当试验场,把 OpenAI 最新 大模型 GPT-6Astra 丢进去跑了一次长达141小时的长时自主游戏测试
蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统
Astra for Law 首批通过 Trusted Access 向部分律所开放,可在 ChatGPT 和 Codex 中使用,API 即将推出。
原文引用安全研究人员用 Claude Opus 5 将漏洞扩展为 OpenAI 账户接管的案例。
本期 AI 日报汇总八条动态:微信 AI 团队开源可执行知识库 WeKnora、智谱回应 ZCode 代码上传争议、ChatGPT 官方插件入驻 Word、阶跃星辰 Step5Preview 单任务成本降至 Claude Opus5 的 1/8、SpaceXAI 语音转写错误率减半、B 站上线 AI 竞技场测评榜、千问同传延迟降至 2.3
哎呀。以前"快"可是件坏事 💅
3 名安全研究人员使用 Claude Opus 5 仅用几小时、Token 成本不到 3000 美元,将图片上传漏洞扩展为 OpenAI 员工账户接管,并通过 Codex 提交内部 PR。
中国顶级的 AI Lab,在使用 Nvidia 芯片做训练,并且开始大量使用华为芯片做推理,是这样么?
Baseten CEO Tuhin Srivastava(@tuhinone)刚抛出 2 个数字,展示 AI 推理增长有多快:
早在7月,有一份报告在网上引起广泛关注,称 Waymo 比纽约的营运车辆更危险。该分析后来被证明是错误的,更新后的报告发现 Waymo 要安全得多。好在他们用新数据做了更新,不过 https://www.openplans.org/how-for-hire-autonomous-vehicles-impact-nyc
这个周末你是怎么用 grok bot 的?分享你最好的技巧!
Anthropic 打算把敲钟的日子往后挪一挪。据《华尔街日报》9月19日报道,这家 Claude 开发商计划将首次公开募股推迟到11月,比许多投资者此前押注的10月晚了一步。知情人士透露,部分顾问认为多等一个月,能让公司把第三季度的财务数据摆上桌,用真金白银证明自己的竞争地位——这纸报表,正是当下最硬的说服工具。市场
据路透社报道,三位消息人士透露,Anthropic 正考虑推出一款全新人工智能模型,以应对 OpenAI 发布 GPT-6 Astra 之后的强劲发展势头。此事发生在公司筹备 IPO 前夕——就在此前,其首席执行官还呼吁整个 AI 行业放缓技术迭代的脚步。消息人士称,推新模型意在直面来自直接竞争对手的压力。此前,Ant
雷神要给"本地跑大模型"这件事换个重量级解法。9月20日,雷神宣布旗下首款人工智能移动工作站 AI Master M7000将于明日(9月21日)上午10:00开售,号称能"端侧驯服"1200亿参数的大模型,首发叠加国补后到手价1.99万元。创作、开发、科研、涉密四大场景被它一次
阶跃今天全量开放新一代旗舰基座 Step5Preview,定位很明确——一款为真实世界里 Agentic 任务而生的主力模型。它想解决的是 AI 模型里那道经典的"帕累托题":能力、效率、成本三个目标互相拉扯,历史上想在一个维度上往前走,往往得拿另一个维度去换;而推进帕累托前沿,不是让取舍消失,而是
在全球顶级 AI 数学基准 FrontierMath 上,一道悬了九年、自2017年就被抛出的"重大进展"级开放难题被拿下——而这次的功臣是 GPT-6Astra 与三位人类研究员的人机组合。题目问的是批准式委员会选举里"核是否为空",本意是寻找"核为空"的反
昨天一款名为 Step 5 Preview 的国产大模型突然杀出,仅用 6000 亿参数量就达到了 2.8 万亿参数量 K3 级别的性能,性价比非常高。今天该模型正式全量开放——API 和 Studio 已经可以使用,10 月 15 日还将发布完整权重模型。Step 5 Preview 是阶跃星辰推出的旗舰模型,采用稀
9B 站宣布上线“AI 无限竞技场”大模型测评榜,并同步公布了首轮模型排行榜。其中 GPT-6 Astra 在 10 个 UP 主测评中拿下榜首,打败 GLM-5.3 获得“榜首次数冠军”;前五名中,国产大模型占据三席。据 B 站介绍,“AI 无限竞技场”是一个汇集 UP 主 AI 大模型测评的竞技广场,由各领域 UP
B站今天端出了一块大模型擂台——"AI 无限竞技场"测评榜,并同步亮出首轮排行榜。在10位 UP 主的真机实测里,GPT-6Astra 拿下榜首、并且抢下"登顶次数冠军",把 GLM-5.3压在身后;前五名里国产大模型占了三席,和海外巨头贴身肉搏。这块竞技场和传统跑分榜的玩法不一
9月19日,DeepSeek正式发布API峰谷时间补充说明,明确调休上班的周末以及中国法定节假日全天,均按空闲时段计费。这意味着,9月20日(周日调休上班)、10月10日(周六调休上班)以及中秋、国庆假期,开发者均可享受低谷价格调用API。根据DeepSeek此前公布的峰谷定价机制,工作日高峰时段(9:00-12:00
9月20日,消费级具身智能品牌「启元机器人」宣布与腾讯云达成合作,启元Q1、T1机器人正式接入WorkBuddy,成为首个接入WorkBuddy的具身智能企业。这意味着WorkBuddy首次实现"具身化"——从屏幕里的AI助手,变成有耳朵、眼睛和手脚的物理实体。双方的分工清晰明确:WorkBuddy
MiniMax 把自家命令行 AI 编程工具 MiniMax Code CLI 的 v0.4.12版本正式开源,源码已上架 GitHub。作为 MiniMax Code 客户端的核心组件,它不再只是闭门打磨的产品,而是把底层实现直接交到开发者手里。成绩上它拿出了底气。在 FrontierHarness Eval 评测里