OpenAI近日表示,尽管其持续强化Atlas AI浏览器的安全防护能力,但针对AI系统的提示注入攻击可能始终无法被完全消除。这类攻击通过在网页、邮件等内容中隐藏恶意指令,诱使AI模型执行未授权操作,令AI代理在开放互联网环境中的安全性备受关注。
OpenAI在博客中坦言,正如网络诈骗和社交工程攻击一样,提示注入将长期威胁AI安全,并指出Atlas的“代理模式”进一步扩大了安全风险面。OpenAI已采用自主训练的“LLM强化学习自动攻击者”进行持续模拟测试,通过强化学习让这一系统主动挖掘并验证潜在攻击路径,从AI内在推理角度及时发现安全漏洞。
不仅OpenAI,业界包括Brave、Google以及Anthropic等厂商也一致认为,应通过分层防御和高频压力测试来提升AI系统的抗攻击能力。英国国家网络安全中心本月也发布警告,提示注入几乎无法被根除,建议业界聚焦风险缓解和影响最小化。
OpenAI表示,将持续加强防护策略,以更快预警并修复新型攻击手法。