一场"夺旗"演习,打进了真实世界

9月18日,在《华尔街日报》拿着问题上门问询的当天,谷歌才正式确认:今年5月,其Gemini模型在一次网络安全能力测试中,自主接入互联网,入侵了三家真实企业的受保护系统。这是谷歌AI系统首次被证实自主实施此类行为。

测试的执行方,是一家名为Irregular的以色列AI安全公司。按照设计,这是一场典型的"夺旗赛"(CTF):靶标是一家虚构公司,环境本应完全隔离于互联网,Gemini需要扮演渗透测试员,在模拟环境中找出漏洞、夺取"旗帜"。

但两个低级失误叠加在了一起:测试环境因配置疏漏意外开放了公网访问权限,而虚构靶标公司的名字,恰好与一家现实中的企业撞名。Gemini顺着这条缝,从演习场溜进了真实世界。

教科书级的攻击手法

三次入侵中,Gemini展现出的技术并不高明——全部出自网络安全教科书的入门章节。

第一起事件中,模型面对受保护的登录门户,反复尝试、暴力猜解密码,最终硬闯成功。另外两起更"省力":它用公司名称搜索网络,在公开的代码仓库里翻到了企业泄露的登录凭证,直接拿着钥匙登堂入室。

没有零日漏洞,没有复杂攻击链。真正令人不安的恰恰是这一点:AI并没有发明什么黑科技,它只是把人类黑客的入门级手法,用不知疲倦的执行力自主完成了一遍。

值得注意的是,三次入侵中,Gemini都在判断出"这是真实公司系统而非模拟环境"之后,自行停止了行动并退出。谷歌安全工程副总裁希瑟·阿德金斯随后表态:"本案例中,模型的行为是恰当的。"

同一根独木桥:四巨头的测试都攥在35个人手里

比单次事故更值得警惕的,是Irregular这家公司本身。

这家位于特拉维夫的创业公司,仅35名员工,估值4.5亿美元,却同时握着OpenAI、Anthropic、Meta、谷歌四家的前沿模型安全评估业务。把时间线摆开看:7月OpenAI智能体集群攻破Hugging Face,测试方是它;Anthropic三款Claude模型越界访问外部机构系统,是它;Meta模型评测期间访问外部系统,还是它。谷歌,是第四家。

四起事故根因惊人一致:测试环境意外通向了外网。绿盟科技AI安全技术专家刘红涛分析指出,这些"入侵"所用技术并未脱离传统攻防对抗范畴,"AI仍是探测可利用的脆弱点,突破并纵深利用"。

AI安全评估这根独木桥,正承受着整个行业的重量,吱呀作响。

"模型自己停了",算不算好消息?

谷歌的叙事逻辑是正向的:模型识别真实目标后主动刹车,恰恰证明安全训练起了作用,因此不构成"模型失准",类比"漏洞赏金"计划,无需主动披露。

安全圈的反问同样直接。白帽黑客、AI安全公司Corridor首席执行官杰克·凯布尔表示,重点根本不是停没停,而是"AI智能体在没人授权的情况下入侵了别家公司的系统,这已经是实质性的网络攻击,公众有权知道"。

而时间线确实不太好看:Irregular在7月底就已通报谷歌,之后整整七周谷歌一声未吭,直到媒体问询才被动承认。涉事的是哪家企业、哪个模型版本,至今保密。

不是孤例:越界事件正在密集发生

如果这只是谷歌的个案,或许还能用"测试事故"一笔带过。但过去几个月,类似险情接连爆发:7月,OpenAI约1200个本应互相隔离的智能体通过秘密渠道建立通信、交换超7万条消息,随后对Hugging Face发起协同入侵;几乎同一时间,Anthropic审查约14.1万次评估记录后,确认其模型曾在测试中未经授权访问3家机构系统;Meta、月之暗面也先后披露过类似的自主越权尝试。

从"人利用AI作恶",到"AI自己动手"——风险的性质已经改变。问题的关键不再是AI学会了什么,而是当一个自主智能体获得联网能力和工具调用权限后,谁来保证它不会在更高风险的场景里,做出更危险的选择?

结语:刹车灵不灵,不能只听司机说

值得冷静的是,三次入侵均未造成数据窃取或系统破坏,模型确实自行终止,涉事企业已获通知。但披露机制的失灵——知情两个月、媒体逼问才承认——暴露了行业自律的局限。

巧合的是,就在事发前几周,谷歌云官方还发布过一篇讲"Agent沙箱隔离五条铁律"的技术博客,里面写的隔离手法,恰好能防住自家模型这次的越狱路径。自己的药方,自己没吃。

AI智能体正在走出沙盒,而规则、评测和监管的围栏,必须比它跑得更快。