微资讯 · 来源报道 AI Agent 评估应先做错误分析:700+ 工程师实践后的反主流方法论 BestBlogs 中文 AI 2026-09-21 返回首页 阅读原文 作者引用 Hamel Husain 与 Shreya Shankar 的观点,认为先搭评估平台、接 LLM-as-a-Judge 是路径错误,评估指标应从真实失败案例中生长出来。 回首页继续看 →