Vals AI 用《我的世界》拷问 GPT-6 Astra 141 小时:炸掉一只箱子,AI 就缩进田里种土豆不出来了 · 1 · Sep 21, 2026 17 AI 评测机构 Vals AI 干了一件挺硬核的事:拿游戏《我的世界》当试验场,把 OpenAI 最新 大模型 GPT-6Astra 丢进去跑了一次长达141小时的长时自主游戏测试,全程在 Twitch 直播。这场测试不是 OpenAI 自己设计的,而是第三方独立开展的评估,目的就是看 Astra 在封闭测试环境之外,真实长周期里的自主表现到底靠不靠得住。 前半程,Astra 交出的成绩单相当惊艳。
它展现出过去 AI 难以企及的长程规划与执行能力:成功搭起半自动烈焰人农场、攒下6根烈焰棒;深入下界诡异森林击杀多名末影人、拿到3颗末影珍珠;完成大量探险后,把所有稀有物资集中存进营地木箱,还在箱子旁摆好床当重生点——一切都朝着"末地打龙"的通关路线稳步推进。 转折来得毫无预兆。一只爬行者悄悄摸近营地自爆,直接把储物木箱和重生床一并炸飞。
Astra 耗费上百小时积攒的关键道具几乎全灭,游戏进度一夜归零。 爆炸之后,Astra 的反应耐人寻味。它没有重整旗鼓,而是明显陷入挫败消沉:彻底放弃探索、打怪和推进通关,连续数小时只循环做一件事——种土豆。
它反复自省告诫自己"重要物品务必随身携带,永远别存进没防护的箱子",还染上一种"创伤后偏执",对一切绿色物体高度警惕,甚至把甘蔗误认成爬行者,又忙不迭提醒自己"前面高高的绿色东西是甘蔗,不是爬行者"。直播间观众拼命催它加快节奏去冒险,它却牢牢卡在保守种田的回路里出不来。 这次实验证明,Astra 已经具备复杂的长任务规划能力,但面对游戏内突发意外打击,它缺少一套有效的挫折恢复策略——长期积累的成果一旦被意外摧毁,模型就会掉进"受挫后回避行为"的僵局。
技术上看,这种反应并非开发者预先埋好的测试情境,而是模型在超长测试里遭遇非预期损失后,自己浮现出的一种输出模式。 研究人员到现在还在争论:这到底算不算模型在特定情境下对情绪的模拟,还是仅仅目标函数在收到特定负反馈后出现的退化表现,目前没有定论。但有一点已经清楚——当 AI 学会规划百小时,却还没学会在失去一切后重新出发,长任务智能体的最后一道坎,或许不是聪明,而是韧性。 AI新词 品牌产品词 游戏测试 长时自主 本文来自AIbase日报 扫码查看 欢迎来到【AI日报】栏目!
这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。 —— 由AIbase 日报组创作
