在追求更强大 AI 能力的同时,模型如何确保自身安全已成为行业核心命题。近日,OpenAI 发布了全新的自动化红队测试模型 GPT-Red,通过规模化的自博弈训练,成功将模型在直接提示注入攻击中的失败率压低至0.05%,为 AI 的自我迭代与安全性提升开辟了一条新路径。
随着 AI 系统通过浏览器、本地文件及各类 API 深度接入现实世界,安全边界变得愈发脆弱。传统的红队测试虽然有效,但高度依赖人工,难以跟上模型能力的指数级增长,也无法产出足够的对抗数据来优化防御。OpenAI 此次推出的 GPT-Red,正是为了打破这一瓶颈。它不仅能在部署前精准定位模型漏洞,更重要的是,它能实时生成大规模的对抗样本,推动模型在训练阶段就完成防御升级。