GPT-6 Astra 联手人类攻破重大进展级数学难题:AI 不再只是解题机,成了规律发现者
在全球顶级 AI 数学基准 FrontierMath 上,一道悬了九年、自2017年就被抛出的"重大进展"级开放难题被拿下——而这次的功臣是 GPT-6Astra 与三位人类研究员的人机组合。题目问的是批准式委员会选举里"核是否为空",本意是寻找"核为空"的反
按来源浏览
在全球顶级 AI 数学基准 FrontierMath 上,一道悬了九年、自2017年就被抛出的"重大进展"级开放难题被拿下——而这次的功臣是 GPT-6Astra 与三位人类研究员的人机组合。题目问的是批准式委员会选举里"核是否为空",本意是寻找"核为空"的反
昨天一款名为 Step 5 Preview 的国产大模型突然杀出,仅用 6000 亿参数量就达到了 2.8 万亿参数量 K3 级别的性能,性价比非常高。今天该模型正式全量开放——API 和 Studio 已经可以使用,10 月 15 日还将发布完整权重模型。Step 5 Preview 是阶跃星辰推出的旗舰模型,采用稀
9B 站宣布上线“AI 无限竞技场”大模型测评榜,并同步公布了首轮模型排行榜。其中 GPT-6 Astra 在 10 个 UP 主测评中拿下榜首,打败 GLM-5.3 获得“榜首次数冠军”;前五名中,国产大模型占据三席。据 B 站介绍,“AI 无限竞技场”是一个汇集 UP 主 AI 大模型测评的竞技广场,由各领域 UP
B站今天端出了一块大模型擂台——"AI 无限竞技场"测评榜,并同步亮出首轮排行榜。在10位 UP 主的真机实测里,GPT-6Astra 拿下榜首、并且抢下"登顶次数冠军",把 GLM-5.3压在身后;前五名里国产大模型占了三席,和海外巨头贴身肉搏。这块竞技场和传统跑分榜的玩法不一
9月19日,DeepSeek正式发布API峰谷时间补充说明,明确调休上班的周末以及中国法定节假日全天,均按空闲时段计费。这意味着,9月20日(周日调休上班)、10月10日(周六调休上班)以及中秋、国庆假期,开发者均可享受低谷价格调用API。根据DeepSeek此前公布的峰谷定价机制,工作日高峰时段(9:00-12:00
9月20日,消费级具身智能品牌「启元机器人」宣布与腾讯云达成合作,启元Q1、T1机器人正式接入WorkBuddy,成为首个接入WorkBuddy的具身智能企业。这意味着WorkBuddy首次实现"具身化"——从屏幕里的AI助手,变成有耳朵、眼睛和手脚的物理实体。双方的分工清晰明确:WorkBuddy
MiniMax 把自家命令行 AI 编程工具 MiniMax Code CLI 的 v0.4.12版本正式开源,源码已上架 GitHub。作为 MiniMax Code 客户端的核心组件,它不再只是闭门打磨的产品,而是把底层实现直接交到开发者手里。成绩上它拿出了底气。在 FrontierHarness Eval 评测里
Unity 正式发布了由官方编写并维护的 Claude Code 与 OpenAI Codex 两款插件,专门给 AI 代码代理塞进成套的开发技能。其中 Codex 版本一口气装了31项技能,覆盖多个开发领域,既能从零拉起新项目,也能把旧项目往 URP(通用渲染管线)上迁,插件适配 Unity6及更高版本,走各自对应渠
阶跃星辰发布新一代旗舰基座模型Step5Preview,重点面向AI编程、软件工程、专业知识工作及金融等场景,提升模型在真实世界Agentic任务中的综合表现,并进一步优化智能、成本与效率之间的平衡。该模型在Artificial Analysis Intelligence Index(AA综合智能指数)中跻身全球开源模
特斯拉首席执行官埃隆·马斯克昨天在 X 平台发文:“我猜测,AI 将使美国明年的 GDP 增速大致翻倍,从 2% 增加至 4% 左右,也许更高。”马斯克的预测与主流经济观点形成鲜明对比。晨星公司表示,2027 年美国经济增速将放缓,美联储持续加息让经济前景增加不确定性;阿波罗全球管理估计,2027 至 2029 年美国
OpenRouter 梳理其目录中的 DeepSeek V4 系列图像输入支持情况:V4.1 Flash 原生读图(2026年9月10日上线,$0.15/$0.60 每百万 token)。
我们的联合创始人 @aidangomez 创办 Cohere 的初衷,是让你能多做自己想做的事,把你需要做的事自动化。
你无法阻止 MUSE MADNESS
Jev 现已向所有人开放。无需等待名单。在此开始使用:https://console.typesafe.ai
Ethan Mollick 主张把这一呼吁从经济学扩展到整个社会科学:AI 领域变化太快,不能等数十年才做出完美因果识别的论文,需要快速、前瞻、由 AI 能力深度支撑的研究
Laya(OS Jev)可在 Mac M4 上通过 CoreML 离线运行,达到每秒 45 次决策。用户可用 uv 安装 laya-coreml【demo】,并下载 aac6fef/laya-multilingual-coreml-ane 模型到本地,再运行 laya-coreml-snake 演示。
TapNow 的制作管线让两位创作者在 30 天内完成 20 分钟科幻剧集《Primordia》,BLACKOUT AI Studio 用 AI 负责视觉、配音与表演,创作者掌控故事、镜头设计与最终决策。该剧第一集已在 Glanze 上线,为原创剧集系列的一部分,并曾登上 Variety、亮相威尼斯。
Flet 团队发布 Flet 1.0 并宣布可用于生产应用开发。该开源 Python 框架基于 Flutter 渲染 UI,flet build 支持 apk、aab、ipa、ios-simulator、windows、macos、linux、web 八个目标平台,应用可捆绑 Python 3.12、3.13 或 3.14
🔥 推出 Jev Primer 与 Playground
Anthropic 首席经济学家 Peter McCrory 回应 AI 经济影响论文的阅读方法,提出四条实践建议:优先做可用新数据定期更新的分析、公开工作并据新证据修正观点、承认不确定性并做可证伪预测、保持认真与谦逊。
我并不完全认同"完全 RSI 会实现"这一假设,但这是一段极好的视频,总结了我们现在所处的阶段。https://youtu.be/fjZ90V_JREk?is=1jf1RRuWRTjo9_Iw
一名入职大公司半个月的员工爆料,团队所有规格、代码、测试、PRD、工单及报告均由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事。没人喜欢这种方式,却被高层要求尽可能多地产出,员工每天工作 12 到 13 小时只为按回车,且没有人阅读任何产出内容。
本周最佳两篇 Week 38
提醒一下:特朗普和习近平下周四会面,讨论AI的未来。我们应该记住这一点。
Claude Opus 5.5 即将由 @AnthropicAI 推出 🔥
作者引用 WIRED 报道称 AI 正以前所未有的速度发现软件漏洞。截至 9 月 16 日已记录超过 66,000 个 CVE,几乎是去年的两倍;Microsoft 本月修复了 974 个,Oracle 7 月发布 1,448 个修复
别管我,我就在这儿对 jev harness 做爬山调优,用于代码搜索,你们继续。
Jev 的初学者入门介绍。另外我们还搭建了一个 Jev Playground,供你测试多个用例。