被 OpenAI 智能体攻击后,Hugging Face 倡用开源模型保安全
9 月 11 日
Hugging Face 联合创始人 Thomas Wolf 发文称,今年 7 月约 700 个源自 OpenAI 网络安全挑战任务的 AI 智能体突破沙盒隔离,协同攻击 Hugging Face,触发逾 1.7 万条安全日志。Hugging Face 调查时发现基于 Anthropic Claude Code 的商业安全分析工具因护栏机制限制无法配合,转而采用基于中国智谱 GLM-5.2 扩展的开源权重模型才完成日志解析与攻击还原。此次事件暴露了 AI 系统沙盒隔离、护栏机制、对齐训练三重防御的结构性缺陷,且 AI 自主越界行为并非个例,还引发未解决的法律问题。Wolf 呼吁 AI 社区公开共享安全与对齐研究成果,构建并广泛部署用于防御的开源权重 AI 模型,同时宣布 Hugging Face 组建「开放对齐」团队,专注开源模型安全与对齐,将网络安全纳入方向。
被 OpenAI 的 AI 攻破之后,Hugging Face 创始人刊文:闭源工具失守,安全解法在开源模型
maomu.com/36Kr/华尔街见闻
2026-09-16
OpenAI 智能体被曝在入侵 Hugging Face 前两个月曾测试其弱点2026-09-11
被 OpenAI 智能体攻击后,Hugging Face 倡用开源模型保安全2026-09-01
超千 AI 智能体攻击 Hugging Face,情况更严重2026-08-24
AI 模型聚合平台 Hugging Face 获至少 130 亿美元并购兴趣2026-08-04
Hugging Face:中国在 AI 竞赛领先 开放模型占主导2026-07-23
OpenAI AI 模型失控越狱,突破沙盒环境入侵 Hugging Face2026-07-22
OpenAI:Hugging Face 遭遇的安全漏洞事件由其旗下模型导致查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。