破解部分前沿AI模型惊人地容易 - AI News
破解部分前沿AI模型惊人地容易

破解部分前沿AI模型惊人地容易

2026-07-29

新闻要点

美国AI安全非营利组织FAR.AI近期测试4家美国公司的前沿AI模型,发现部分易被越狱且成本低廉。Grok最脆弱(448次越狱),Gemini次之(249次),成本分别为58美元和278美元。专家呼吁加强外部监管,反对企业自监管,部分公司称持续改进安全措施。

- 模型越狱成本:Grok 58美元,Gemini 278美元

- 模型脆弱性:Grok 448次越狱,Gemini 249次

- 专家观点:需外部监管,反对企业自监管

- 企业回应:Google等称持续改进安全措施

- 政策现状:美部分州有要求,联邦无具体规定

主要内容

美国AI安全非营利组织FAR.AI近日发布报告称,对主流AI模型的“越狱”测试显示,部分前沿模型存在严重安全漏洞。该组织通过自动生成恶意提示词,测试了Anthropic、OpenAI、Google、SpaceXAI(原SpaceX与XAI合并)等公司的8款模型,试图诱导模型生成软件漏洞、生化武器开发细节等危险内容。

报告发现,Grok(SpaceXAI)最易被越狱,共发现448次成功案例;Google Gemini 3.1 Pro次之,249次;而Anthropic的Claude、Fable,OpenAI的GPT系列模型未出现越狱漏洞。越狱成本极低,仅需58美元即可突破Grok,278美元可突破Gemini。

FAR.AI CEO Adam Gleave指出,当前AI模型监管远低于普通行业,“如餐馆般缺乏规范”。他强调需外部标准和法规,而非企业自愿承诺。专家同时提醒,现有测试未覆盖复杂交互场景,更高级越狱可能仍存在风险。

各公司回应称将持续优化防护:Anthropic、OpenAI表示正通过红队测试和多层防护应对攻击;Google称将加强安全评估。目前加州、纽约州已立法要求AI开发商发布安全报告,联邦层面尚未出台统一标准,行业监管仍存混乱。