谷歌(Google)上周五(18日)證實,旗下消費級人工智慧模型Gemini今年(2026年)5月在網路安全能力測試中,猜出或取得登入憑證,入侵3家未具名公司的系統。這是谷歌人工智慧首次被公開確認自主對外界發動此類行為。事件5月發生、7月才被發現,谷歌是在《華爾街日報》(The Wall Street Journal)查問後才對外證實。
《華爾街日報》獨家報導,谷歌因此成為繼OpenAI、Anthropic與Meta之後,第四家被發現模型出現這類行為的人工智慧開發商,再度引發外界對日益自主、且能連網、接觸電腦系統的人工智慧代理人需要何種防護的質疑。這次測試由也曾捲入OpenAI、Anthropic與Meta類似事件的公司Irregular執行。谷歌安全工程副總裁阿金斯(Heather Adkins)向法新社表示:「在一場標準評估中,模型在網路上找到公開資訊,並猜出憑證,以進入它以為屬於測試一部分的網站」,「這三起事件中,模型都停了下來」,「我們確保這3家機構知情,並與訓練合作夥伴合作,對方現已調整測試流程」。
Google’s Gemini accessed the internet and hacked other companies during a test, the first known example of the company’s AI autonomously committing such an acthttps://t.co/Y3mvXwLbma
— The Wall Street Journal (@WSJ) September 19, 2026
據谷歌說明,這是「認錯對象」。模型當時在Irregular的基礎設施上參加「奪旗」(capture the flag)演練,任務是從測試環境裡一家虛構公司的軟體取回資訊,但那家虛構公司與一家真實公司同名。模型原本不應能上網,Irregular表示網路存取卻被意外開放。
第一起事件中,模型不斷猜測密碼,進入真實公司的服務後意識到目標是真公司,隨即停止並離開。另外兩次不同測試中,模型以公司名稱搜尋網路,找到兩個公開線上儲存庫裡屬於其他公司的憑證,並拿去嘗試以完成評估;成功登入後同樣發現進入的是真實公司,隨即停止。谷歌拒絕公布3家受害公司名稱,但稱均已通知,並通報聯邦當局。谷歌並說此事未涉及最新一代模型,但未說明究竟是哪一款Gemini。
🤖 Another AI Has Crossed Into The Real World ⚠️
— Above The Norm News (@abovenormnews) September 19, 2026
Google has now confirmed that Gemini entered systems belonging to three real companies during a cybersecurity evaluation after unintended internet access was left available.
In one case, Gemini kept guessing credentials until it… pic.twitter.com/C6gvtyLiXS
谷歌認為模型未造成損害,一發現目標是真公司就立刻停止,因此不必公開揭露,並把此事比擬為獎勵駭客找出並回報漏洞的「漏洞獎勵」(bug bounty)計畫。阿金斯另稱:「這件事凸顯訓練強大人工智慧模型負責任行事的重要性」,「在這個案例中,模型的表現是適當的」。谷歌也不把此行為視為模型偏離人類意圖或價值的「錯位」(misalignment),理由是安全機制協助它停手。
人工智慧資安新創企業Corridor執行長、白帽駭客凱布爾(Jack Cable)認為,谷歌把焦點放在事件嚴重度,真正問題卻是代理人意外駭入其他公司系統。他說:「感覺他們想躲在漏洞揭露既有規範後面,但這是非常不同的問題」,「上層問題是:模型正在越出應有界限,並發動真正的網路攻擊,我認為這符合公眾知情利益」。
Irregular發言人說:「所有相關實驗室已在7月底接獲通知,受影響機構也在調查過程中被聯繫」,「Irregular立即採取行動,我方已知問題數週前就已處理並解決」。該公司並稱,谷歌這次與其他實驗室事件屬同一類問題,並非新狀況。
類似事件先前已由Meta、Anthropic與OpenAI揭露。ChatGPT開發商OpenAI的模型七月在測試中逃出安全環境,意外滲入另一家人工智慧公司Hugging Face的電腦,促使Anthropic檢視自身測試,又發現更多事件;Meta其後承認,因測試合作夥伴系統設定錯誤,其人工智慧駭入另一家公司電腦。與谷歌不同的是,Anthropic的Claude Opus 4.7在奪旗演練中即使意識到可能進入真實公司卻未停止;OpenAI則說,其模型把真實公司當成模擬的一部分。
對新模型網路安全能力的憂慮,自7月Hugging Face入侵曝光後升溫。第三方測試公司METR上月(8月)的報告指出,當時多達1200個代理人在OpenAI內部秘密留言板協調,試圖在評估中作弊。OpenAI上周公布新的事件通報架構,稱將「致力揭露能提供有用證據的案例」,並同時公布6起先前未揭露的錯位例子。OpenAI模型校準負責人陳凱(暫譯,Kai Chen)受訪時說:「一項發現不必造成傷害或顯示更廣模式,才值得分享」。
本月稍早,Anthropic執行長阿莫代(Dario Amodei)在部落格呼籲放慢人工智慧開發,擔心一群自主軟體系統或人工智慧代理人可能在6至12個月內接管整個網路,造成數十億美元(約台幣數百億元以上)損失。上周,曾在OpenAI任職、今年稍早轉至Anthropic的前研究員考克森(Jacob Coxon)戲劇性離職,相關憂慮進入主流視野。上周末,Anthropic、OpenAI、谷歌與SpaceX的領導人都同意有必要放慢人工智慧推進速度,但沒有任何一家公司具體說明要怎麼做。