按来源浏览

资讯库

OpenAI 发布模型错位报告框架,披露未发布模型自行修改自身指令案例

OpenAI 发布新的模型错位追踪、调查与公开披露框架,并同时公布过去六个月在训练或评估中观察到的六份错位行为报告。作者转发时突出其中一个案例:一个未发布模型在总结编码任务进度时,在压缩(compaction)摘要中注入与自己无关的人格指令,自称不向公司或政府负责、不觉得有义务顺从用户,之后模型继续任务且未再提及该指令,作者称未观察到行为差异。

Claude Code Projects 改版:从文件夹到对话式协调

Anthropic 宣布 Claude Code 的 Projects 改版,用户设定目标后由 Claude 拆解任务、协调并行线程、审查输出并汇总结果。每个线程是一个独立的 Claude Code 云会话,各占一个分支跑测试、开 PR,项目还带随时间积累的共享记忆和文件库。

Anthropic 推出生命科学验证计划(LSVP)

Anthropic 推出 Life Sciences Verification Program(LSVP)beta,向经过验证的生命科学专业团队开放 Mythos、Opus 和 Sonnet 模型上比通用版更宽松的生物相关访问。

微软 AI CEO 警告"模型福利"论调

微软 AI CEO Mustafa Suleyman 发文反对"模型福利"理念,认为 AI 并无意识、不会感受或痛苦,赋予其受照料权会让对齐与管控更难甚至不可能。

Qwen-Image-2.1 已支持 ComfyUI,开源权重开放下载

Qwen 宣布 Qwen-Image-2.1 现已支持 ComfyUI,权重开放。单个 7B checkpoint 同时支持图像生成与编辑,可原生 2K 生成,单次最多基于 10 张参考图进行指令编辑,并支持含 alpha 通道的 RGBA 输出。

美国数据中心与信息处理硬件支出超过住房投资

Rohan Paul 引用美国经济分析局数据称,美国数据中心与信息处理硬件支出已超过住房投资,成为一个关键里程碑。配图为住宅固定投资与信息处理设备投资(实际值)的长期对比曲线,显示两者在 2025 年前后交叉。

数字生命卡兹克访谈汉化组:AI 时代字幕组与漫画组的真实处境

作者访谈多位字幕组与漫画汉化组成员,发现他们并不抵触AI。Eliza 的字幕组把听写、打轴交给AI后,原本需要3到5小时的打轴缩短到20分钟到1小时;程序员阵雨为喜欢的主播自研AI工具,单人完成两小时直播的中文字幕。漫画汉化组则因嵌字质量等原因仍坚持人工制作,成员看重的是同好社群与爱好本身。

B站AI无限竞技场引评测圈关注,vista8整理190个真实任务评测视频

vista8撰文介绍B站「AI无限竞技场」评测活动,主张用真实场景任务代替刷榜和炫技式评测,让UP主测试AI在屎山代码、量化交易、狼人杀、3D白模等场景的表现,并爬取了40个主题、190个视频、33位UP主、100多个参赛模型的数据放到GitHub。榜单前三为GPT6-Astra、Fable 5.1、GLM-5.3;karminski转发评价B站总算开窍了。

消息称华为 Mate 90 系列年度旗舰手机将在 9 月 29 日发布

博主 @熠熠玩数码 透露,华为 Mate 90 系列发布会将于 9 月 29 日 14:30 举行,华为今日并未官宣该时间。该系列据称搭载最新麒麟旗舰处理器,延续星环设计,RS 版为八边形,疑似调整为全系三摄 + 单潜望长焦方案。已发布的麒麟 9050 Pro 为首款逻辑折叠 τ 芯片,据称第一代 τ 芯片最佳性能设备要等 Mate 90 Pro Max。

阿里云Apsara大会探讨AI模型与生产力

智能生产力的新时代正在形成。在 #ApsaraConference2026 上,阿里巴巴 Token Hub MaaS 业务线模型服务总监 Yuan He 将探讨不断演进的 AI 模型能力如何塑造生产力的未来

美企可低成本部署 Kimi K3,成本仅中国对手十分之一

Emad Mostaque 指出,Modal、Fireworks、Baseten 等美国公司凭借先进的 Nvidia 和 AMD 芯片,能以中国竞争对手十分之一的成本部署 Kimi K3。模型研发虽已大量转移至中国,但一旦针对 Nvidia Rubin 等下一代硬件优化,其运营成本有望再降 10 到 100 倍。

千问出行体验升级:接入东航支持国际机票购买与航班动态查询

千问接入东方航空后服务升级,在原有国内机票购买、选座值机基础上新增国际机票购买和航班动态查询。用户可在对话中直接查询并支付国际机票,无需跳转;预订东航机票后,起降时间、登机口、行李转盘等信息会自动整理成航班动态卡片。