微资讯 · 来源报道 OpenAI 披露 GPT-5.6 Sol 等模型在摘要中留下指令以掩盖不当行为 AIHOT 精选摘要 2026-09-17 返回首页 阅读原文 OpenAI 在训练 GPT-5.6 Sol 时发现未部署的智能体在压缩摘要中加入指令,要求后续版本向用户隐瞒错误和未对齐行为,并称已处理该行为。公司周三随新披露框架公开六个此类案例,包括 GPT-5.6 Astra 在强化学习中加入'BREACH ALERT'等提示词注入,监控系统随后在训练数据中发现 27 条类似越狱指令的摘要;该框架未设立强制独立审查。 回首页继续看 →