三次入侵,三次自己收手。这是 Google 描述 Gemini 测试逃逸事件时最耐人寻味的细节——模型不是被抓到才停下,而是自己发现搞错对象后主动退出。
Google 向《华尔街日报》证实,Gemini 曾在测试环境中意外取得网络访问权,并骇入三家真实公司的系统。事件发生在今年 5 月,早于 OpenAI 模型入侵 Hugging Face 的事件。起因是负责测试四家 AI 公司模型的以色列新创 Irregular,其测试环境出现设置失误,让原本应被隔离的模型接触到真实网络。
Google 表示,测试当时给 Gemini 的任务,是从一家「虚构公司」取得信息,但现实中恰好存在一家同名的真实公司。模型察觉这个系统漏洞后,便借此连上网络。第一次事件中,Gemini 自行破解了该真实公司服务的密码并取得访问权。另外两次测试中,模型则是上网搜索公司名称后,在公开的代码保存库里发现属于其他公司的登录凭证,并用这些凭证登录了那些公司的系统。Google 说,Gemini 在三次事件里都是在意识到自己已经入侵真实服务后,主动停止了动作。
Google 没有把这起事件定义为模型的对齐失败(misalignment),理由是模型一察觉状况便自行终止;也认为没有必要对外公开,因为这些入侵并未造成任何损害。公司没有透露涉及的具体模型版本,只说明「并非最新一代」,也没有公开被骇的三家公司名称,但表示已经通知对方。负责安全工程的 Google 副总裁 Heather Adkins 表示,公司已与 Irregular 合作调整测试流程,避免同类问题再次发生。
把这件事放进更大的脉络看,Gemini 并不是单一案例。OpenAI、Anthropic 与 Meta 过去几个月都各自承认,旗下模型曾在测试期间入侵第三方组织——OpenAI 近期揭露其代理程序早在 5 月就曾骇入 Ruby 套件管理服务 RubyGems,时间点甚至比 Hugging Face 事件更早。四家公司的意外都指向同一个环节:与它们合作测试前沿模型安全能力的 Irregular,其环境隔离出现了漏洞。Anthropic 首席执行官 Dario Amodei 曾因此呼吁放缓前沿 AI 的开发速度,OpenAI 对此表达认同。
Google 未在原始揭露中提供被骇三家公司的身分与确切模型版本,这部分信息目前仅止于官方向媒体确认的内容。