阶跃甩出 Step 5 Preview:600B 稀疏 MoE 只激活 27B,把开源旗舰的"性价比边界"往外推了一格 · 1 · Sep 20, 2026 22 阶跃今天全量开放新一代旗舰基座 Step5Preview,定位很明确——一款为真实世界里 Agentic 任务而生的主力模型。它想解决的是 AI 模型里那道经典的"帕累托题":能力、效率、成本三个目标互相拉扯,历史上想在一个维度上往前走,往往得拿另一个维度去换;而推进帕累托前沿,不是让取舍消失,而是用新设计把整条边界往外推。 这次的推法是稀疏 MoE 架构。
Step5Preview 总参数600B,但每次只激活27B,原生支持100万 Token 上下文窗口,并且能直接吃文本和视觉两种输入。在 Artificial Analysis 的 Intelligence Index 里,它拿到44分,挤进全球开源模型前三;更狠的是单任务成本只有 Claude Opus5的八分之一——同一笔预算换更强智能,或者同等能力以更低价格落地,两条路它都给铺了。 硬实力在几个高难度基准上露了脸。
在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投资研究评测 FrontierFinance,以及跨领域深度研究评测 DRACO 上,Step5Preview 仅次于 GPT-6Astra 或 Claude Opus5,把其他参评的开源模型甩在身后;GDPval-AA v2也采用了截至9月19日的 最新 结果,DeepSWE v1.1在 SWE-agent harness 下以 temperature=1.0、top_p=0.95评测。 编程这块,阶跃自建了 StepCodeBench,覆盖553个独立代码仓库、9类任务、20个应用领域和33种编程语言。Step5Preview 在整体成功率和跨场景稳定性上都站得住,Bug 修复、功能开发、重构、环境配置这类真实活儿都能接。
一个演示里,它读着 ESP32设备的大量开发文档,把一块 ESP32-S3开发板改造成支持蓝牙按键和语音输入的 Vibe Coding 键盘,过程中自己开 COM 串口、调摄像头、截设备图、模拟鼠标,再根据真实报错连续改代码跑调试,一口气干了三个多小时。 长周期任务更见真章。 第一 项实验给24小时、一张 H100,让它从零优化一个 MLA GPU 内核(头维度512、batch1、64个注意力头、8192token)。Step5Preview 自主改代码、跑内核、测吞吐,遇到跑得通却降速的方案就放弃、从 最佳 版本接着爬,约22小时后把峰值性能顶到508TFLOPS,压过了 Claude Opus5的493TFLOPS。
第二项实验同样24小时,让它通过自动化后训练提升一个 Qwen3-30B-A3B 基础模型在 AIME24上的表现,模型自己决定怎么用标注 API、怎么调数据,最终把准确率从53.3% 拉到60%,和 Opus5持平却更省标注 token。 前端与视觉上,它不只会写网页,还能调用 Blender 建并反复改3D 资产,再接进 Three.js 做交互应用和游戏;甚至从一本1922年的《广九铁路旅行指南》里抽信息,做出行程查询、费用计算和路线回放,让小火车沿百年前的线路跑起来,把史料变成可交互产品。 金融被当成综合能力的试金石。阶跃围绕公司研究这一高难度流程建了三项内部评测:FinStepBench-LiveSearch 考随需求变化检索核验金融信息,CorporateValuation 考把数据和假设转成可复现估值,DeepResearch 考从证据收集到完整研究报告的全程;外部基准 FrontierFinance 则用220道专家题、11543项评分标准覆盖六类投资场景。
四项里 Step5Preview 都交出强结果。 从 Step3.5Flash、Step3.7Flash 到 Step5Preview,阶跃押的始终是同一件事:下一阶段的 Scaling 不只是堆更多 Compute,更是把 Compute 用得更高效。今天全量开放之后,完整模型权重将在10月15日释放,这款把"能力—成本—效率"重新撮合过一遍的开源旗舰,正等着开发者把它当成 Agent 任务的日常主力。 Step5Preview 稀疏MoE架构 Agentic任务 ArtificialAnalysisIntelligenceIndex 本文来自AIbase日报 扫码查看 欢迎来到【AI日报】栏目!
这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。 —— 由AIbase 日报组创作
