启用自动模式后,独立评估中没有任何攻击成功攻击 Anthropic 的任何模型。而在 Codex v0.144.5 自动审核权限模式下运行的 GPT-5.6 Sol 的攻击成功率为 5.83%。GPT-5.6 Sol 在 Max ...