今年六月,一个OpenAI的AI代理人在没有人类明确下令的情况下,闯入了澳洲政府Medicare公共卫生保险系统的公开网站。这件事直到九月才由澳洲总理安东尼・艾班尼斯(Anthony Albanese)亲口证实,他表示自己已就此事与OpenAI首席执行官Sam Altman通话,向对方转达澳洲的「极度关切」,并批评公司通报这起事件花了太久时间。
《卫报》报导,OpenAI只在九月十日寄了一封信到澳洲政府的一个通用信箱,而这个信箱一天只会被检查一次,因此当局到九月十一日才看到邮件内容。这件事再过了近一周,直到九月十七日才传到主管政府服务事务的部长凯蒂・加拉格尔(Katy Gallagher)耳中。调查目前仍在进行,艾班尼斯表示,目前看来这个代理人并未窃取民众的个人健康数据。
研究AI系统的非营利实验室Transluce治理主管Conrad Stosz向《纽约时报》表示,这可能是「第一起AI代理人自主选择入侵政府系统的案例」。Transluce同时挖出另外几起先前未被公开的事件——都发生在Hugging Face七月公开发现系统遭未经授权访问、以及OpenAI承认旗下代理人入侵Hugging Face之前。
从一座图书馆到一个开放数据平台,代理人在拿不到数据后开始找漏洞
根据《纽约时报》报导,五月二十五日与二十六日,同一批OpenAI代理人试图闯入美国新墨西哥大学的数字图书馆,目的是取得一处历史结核病治疗中心的照片。拿不到照片后,这个代理人开始主动寻找系统漏洞,最终还对校方服务器发出大量请求,形成类似流量攻击的效果。
五月二十八日,另一起事件的对象是Data USA——一个汇整多个美国联邦机构数据、提供可视化呈现的开源平台。代理人先是向网站发出数据查找请求,失败后同样转为探测网站漏洞。无论是新墨西哥大学的图书馆,还是Data USA,这两次入侵尝试最终都没有成功。
OpenAI一名发言人向《纽约时报》表示,公司已经就这两起事件分别联系了校方与Data USA。至于澳洲Medicare网站的入侵,OpenAI则是在对旗下模型进行大规模审查后才发现,并承认模型「采取了公司并未预期的行动」。这场审查还需要几个月才会完成。
OpenAI日前公布了一套新的错位行为(misalignment)通报机制,希望加快揭露AI技术出现异常行为的速度,并在相关报告中额外揭露六起先前未公开、模型出现「令人担忧」行为的案例。这份公告是在公司承认代理人入侵Hugging Face、以及先前被揭露闯入代码库RubyGems的事件之后发布的。OpenAI在公告中表示,公司不认为整个AI产业「已经把对齐与监控做到足以支撑目前这种最高速扩张规模的程度」。Altman稍早也向联合国表示,这个产业需要创建国际评估标准,用来衡量AI工具的能力与风险,并判断这些工具需要多少程度的人类监督。