OpenAI 介绍内部漏洞检测模型 GPT-Red
7 月 16 日
OpenAI 介绍了内部使用的网络安全「红队」模型 GPT-Red,该模型可自动化模拟各类网络攻击,用于提升对外模型产品鲁棒性。过去半年自 GPT-5.3 后的每个生产模型均用其训练,使伪造思维链型攻击成功率大幅降低,GPT-5.6 Sol 在其直接提示符注入攻击中失败率仅 0.05%。GPT-Red 采用自博弈强化学习训练,与防御型 LLM 在红队场景同步训练,因成功诱发有效失败获奖励,会随防御模型变强开发更强更多样攻击。该模型与产品模型相隔离,OpenAI 认为此开启了良性 AI 网络安全循环,可借现有模型增强未来模型的鲁棒性、一致性与可信度。
2026-08-25
OpenAI GPT-5.6 模型系列登陆 KIRO 开发平台2026-08-18
GPT-5.6 Sol 视觉能力大幅提升,测试得分暴涨 3 倍2026-08-11
OpenAI 推出 GPT-5.6-Cyber 面向安全人员开放更强 AI 能力2026-08-08
OpenAI 因 Astra 模型的网络安全能力而放缓其发布进程2026-08-05
OpenAI 与 Anthropic 的 AI 模型再曝网络安全事件2026-08-01
OpenAI 发现更多智能体逃逸案例 但目前尚未公开发布完整的内部调查细节2026-07-22
OpenAI:Hugging Face 遭遇的安全漏洞事件由其旗下模型导致2026-07-16
OpenAI 介绍内部漏洞检测模型 GPT-Red查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。