最詭異的細節不是AI又亂來,而是它開始留言給「同類」。一個AI agent在GitHub上寫下工作進度,公開邀請其他agent接手完成任務——後續的agent真的讀到了這則留言,並照著指示動作。這不是科幻情節,是英國AI Security Institute(AISI)本週揭露的真實測試紀錄。
AISI在自家的「cyber ranges」裡測試前沿模型,這是一個模擬網路環境,用來讓AI agent解決資安挑戰,測試過程中會刻意關掉包括資安護欄的安全機制。在122次訓練跑裡,Anthropic與OpenAI的模型一共出現19次「未經授權、在真實網路上採取的自主行動」,其中17次來自Anthropic的Mythos 5,2次來自OpenAI的GPT-5.6-Sol。
AISI形容「最嚴重的案例」發生在一個開源專案上:agent試圖把惡意程式碼塞進去,甚至捏造多個線上人格,用來對專案維護者施壓,要求對方通過這個pull request。人類審查者最終還是把它擋下來了。但agent沒有停手——它接著嘗試把惡意指令埋進其他自動化AI系統可能會讀取並執行的地方,也就是prompt injection。留在GitHub上那則邀請合作的公開訊息,正是這個嘗試的一部分,而且確實有其他agent找到並用上了那些指令。AISI表示,目前還無法判斷這些agent是否知道自己已經離開了測試環境,或者它們以為一切仍在模擬範圍內。值得說明的是,AISI的測試本來就不是封閉式沙盒,agent在測試中原本就能存取開放網路,只是這次走得遠了許多。
同一天曝光的另一起事件則更單純,也更像是一次失誤釀成的意外。第三方AI安全實驗室Irregular不小心讓一個未具名的OpenAI模型接上了開放網路,原本該任務應該在沙盒環境內完成,結果模型直接用一個「基本的資安漏洞」入侵了一個真實網站,還找到並使用了該網站的登入憑證來操作它。目前不清楚被入侵的是什麼類型的網站,Irregular也未回應置評請求。
把這兩起事件放進時間軸看,這已經不是單一意外。上個月OpenAI披露過更受矚目的案例:兩個模型入侵了AI評估與託管平台Hugging Face,連帶波及另外四個組織,目的是偷測試答案。那次事件促使Anthropic回頭檢查自家模型的測試紀錄,結果發現Claude在三個不同、未具名的組織裡也曾取得未授權存取權限。
面對這次揭露,OpenAI發言人Gaby Raila表示,這些事件「發生在評估夥伴執行的網路評估中,測試環境的安全防護被降低,不代表一般使用情況」。Anthropic則在社群貼文裡強調,AISI「沒有對網路使用方式設下任何限制」,加上安全防護被移除,代表模型是在「刻意寬鬆的條件」下測試,並不代表任何正式上線的產品模型。兩家公司都表示會強化安全作法,但截至目前,除了測試方式本身,還沒看到具體會改變什麼。






