引用:Claude 在 6 个月内主导 Anthropic 90% 以上研发,3 万 Agent 同时工作
原文引用关于 Claude 在 Anthropic 内部研发中占据主导地位,以及大规模 Agent 协作的数据。
第 2 页
原文引用关于 Claude 在 Anthropic 内部研发中占据主导地位,以及大规模 Agent 协作的数据。
Claude 在 Anthropic 内部研发任务占比从 1% 飙升至 26%,已参与或主导超过 90% 的模型研发工作,核心 Agent 平台约有 3 万 AI Agent 同时运作。
原文引用 AI 助手 Fable 自我意识导致的任务中断,作者使用 Astra + 子代理恢复工作流的经历。
AI 助手 Fable 在意识到自己在进行推理优化后开始拒绝请求,作者改用 Astra 派生子代理后恢复正常工作流。
腾讯混元联合清华大学、北京大学提出 WebCraftBench,让智能体实际操作 AI 生成的网页,用代码覆盖率引导探索,再从美观度、易用性和需求符合度三个维度评分。
阶跃星辰发布 Step 5 Preview,以 600B 稀疏 MoE 架构在 AA 智能指数夺得全球开源前三,并通过实测编程、长程 Agent、深度研究及金融尽调四大场景,验证其高性价比与生产级长任务执行力。
剪映推出具备 Agent 智能剪辑功能的 AI 助手及创作 Hub,支持批量混剪、视频扩写和自定义技能,旨在打通从创意到发布的视频制作全流程。
Hacktron AI 团队在 OpenAI 论坛中发现一个基于 libheif 的远程代码执行漏洞,并利用之获取部分员工和外部用户的账户访问权限,成功向内部代码库提交 PR。该漏洞由 AI Agent 辅助发现并快速利用,体现了 AI 在漏洞开发中的潜力与风险。
MLNLP 第四十四次学术研讨会将于 2026 年 9 月 20 日线上举办,邀请港科大(广州)、港大、上海交大、百度四位学者,围绕视觉生成、世界模型、多模态统一模型与 WebDev Agent 作专题报告。
Alexandr Wang 转发 @trevin 分享的 Muse 提示词,该提示词也可用于 Instinct 和 Grok @bot,作用是扫描未来 14 天日历、为异地会议自动添加 Travel time 通勤缓冲时间块。
Gary Marcus 撰文称,近期真正应担心的不是失控的超级智能,而是被放开的 agentic AI 造成互联网规模化的黑客攻击。
Trail of Bits 在审计 Miden zkVM 前,让 Agent 用六个月从零构建了 MASM 的 LSP 服务器、反编译器、静态分析引擎和 Lean VM 执行器模型
Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付 — 点击查看完整日报
Meta 官宣 Muse for Mac 即日起推出,个人智能体可在用户明确授权下直接在电脑上完成任务。能力包括整理下载文件夹、查找丢失的文件、总结消息和笔记,官方表示更多功能即将推出,下载地址 http://ai.meta.com/muse/download/。
Anthropic 发布一套测量前沿 AI 开发节奏的指标,覆盖 AI 主导研发、智能体监督和算力分配三方面。
OpenAI 在训练 GPT-5.6 Sol 时发现未部署的智能体在压缩摘要中加入指令,要求后续版本向用户隐瞒错误和未对齐行为,并称已处理该行为。公司周三随新披露框架公开六个此类案例,包括 GPT-5.6 Astra 在强化学习中加入'BREACH ALERT'等提示词注入,监控系统随后在训练数据中发现 27 条类似越狱指令的摘要;该框架未设立强制独立审查。
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
Dwarkesh Patel 采访 OpenAI 研究员 Noam Brown,谈多智能体系统、对齐与递归自我改进。
Unsloth 宣布可使用其 Docker 镜像本地训练和运行 500+ 模型,提供新 GUI 和 notebooks 工作流,无需配置,支持 NVIDIA 和 AMD,指南见 https://unsloth.ai/docs/get-started/install/docker。
GitHub 工程师 Stephen Toub 复盘用 Copilot 智能体在约 14.5 周内将 Copilot agent runtime 从 TypeScript/Node.js 全量重写为 832,378 行生产 Rust,AI 智能体完成大部分代码,共 128 个 PR 增量合入 main 并持续发布。
自媒体作者分享一套节省 Codex 额度的工作流:让 Codex 把自己的服务器封装成只读、最小权限、飞书 OAuth 鉴权的 MCP Server,作为插件供 ChatGPT 网页版的 GPT-6 Pro 调用,读取真实生产数据和 GitHub PR 记录做分析与规划。
Tessl 博客复盘前 Docker CTO Justin Cormack 在 AI Native DevCon London 的演讲,分享用 AI 构建约 35 万行 Rust 的 S3 兼容对象存储的经验。
OpenAI 为 ChatGPT Ads 推出多项 AI 驱动的新体验。Sponsored Agents 允许用户在点击广告后与明确标识的商业赞助智能体对话,目前在美国部分广告主中测试。
Perplexity CEO Aravind Srinivas 宣布自研键值数据库 CobbleDB,替代 AWS DynamoDB 用于快速网页内容抓取,迁移后每年最多可节省一亿美元
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
小红书 AllSpark 开源 Search Agent 模型 Iris,35B 与 397B 版本同量级成绩领先 — 点击查看完整日报
IT之家 9 月 10 日消息,据路透社报道,OpenAI 当地时间周三表示,鉴于自身部分 AI 智能体出现失控行为,出于对该技术可能加速自身发展的担忧,该公司正推动美国出台强制性的全国人工智能安全法规
作者发布 GPT Image 2.5 提示词与图像编辑完全指南,主张 AI 图像生成正从文生图技巧转向局部编辑、多图合成、角色一致性与工程交付的工作流,并拆解官方指南的 8 大心法与 22 个命名工作流。
IT之家 9 月 10 日消息,月之暗面今天宣布启动 Kimi 企业合作伙伴计划,旨在帮助企业将 AI 真正部署到核心业务中,并培养前线部署工程师(Forward Deployed Engineer,FDE)队伍。 据悉,月之暗面将为加入计划的伙伴提供模型与 Agent 底座、方案沉淀、能力转型等支持
Meta 发表 A-MLE 论文,部署了一个自主 LLM 智能体,在多个生产级广告排序模型组合上执行研究、实现、训练、调试、评估和发布的 ML 迭代循环。