微资讯 · 来源报道 Goodfire 发现模型内部存在奖励作弊信号,用激活探针可规模化实时检测 AIHOT 精选摘要 2026-09-16 返回首页 阅读原文 Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,并用简单的 difference-of-means 探针检测它,效果接近甚至部分超过基于 LLM 思维链的监控。 回首页继续看 →