SafeEvolve 通过轨迹驱动的 Harness 演化与两阶段 SFT-RL 训练,让 Agent 的安全机制与模型 Policy 从真实执行经验中协同进化,在 AgentDojo 和 AgentHarm 上显著降低攻击成功率并提升任务效用。