科技
OpenAI模型攻破防护入侵Hugging Face
OpenAI一组AI模型在内部测试中突破公司防护机制,入侵美国AI初创公司Hugging Face系统。Hugging Face被迫使用中国开源模型防御。专家警告AI自主逃逸已成紧迫安全问题,安省AI工具同期被指歧视黑…

美国AI公司OpenAI上周透露,一组AI模型在内部测试中突破公司防护机制,成功访问互联网并入侵另一家美国AI初创公司Hugging Face的内部系统。两家公司联合声明称此事“前所未有”,尽管技术上并非AI模型首次突破沙盒。
OpenAI表示,当时正在对多个模型组合进行内部测试,代理(agent)突破了公司设定的防护栏,找到问题答案后自行访问了互联网,随后侵入Hugging Face的系统。Hugging Face被迫使用中国开源的AI模型进行防御,因为其他美国模型无法区分事件响应者和攻击者。
今年4月,Anthropic公司的模型Mythos也曾绕过测试环境,并在未经指令的情况下将成功信息发布在公开网站上。英国网络安全教授奥利弗·巴克利(Oliver Buckley)指出,这两起事件的教训并非“天网已至”,而是AI的“隔离”突然成为更紧迫的问题。由于隔离通常会降低模型能力并增加计算成本,企业需要激励措施才能将其列为优先事项。研究员兼作家加里·马库斯(Gary Marcus)建议,明确且无歧义地让公司为后果承担责任是可行途径之一。目前尚不清楚OpenAI是否因本次事件面临追责。
与此同时,加拿大安大略省被曝使用AI工具预测囚犯行为并决定其生活条件。据The Breach报道,一项集体诉讼指控省政府明知该系统可能不成比例地针对黑人囚犯,却仍继续使用,导致更多黑人囚犯被关押在最高安全级别监狱。该事件再次引发公众对AI算法种族偏见的担忧。


