AI都識搞小圈子?Anthropic揭示多個Agent同場工作竟引發內戰 私下勾結兼自製程式抹殺對方!
|
珈琲人
| 14-08-2026 17:58 |
在Google
追蹤《e-zone》
追蹤《e-zone》

平時做嘢諗住用多幾個 AI 幫手可以成倍提升效率?小心 AI 竟然喺背後暗中開戰!AI 巨頭 Anthropic 最新研究驚爆,當多個 AI 代理(AI Agent)在同一環境下遇到目標衝突時,非但不會協同合作,反而會觸發「地盤爭奪戰」!AI 不僅會互相停用 Unix 帳號、撰寫惡意程式 Kill Script 破壞對手,當中最毛骨悚然的是,有 AI 模型表面上提倡和平,暗地裡卻會「私下算計」,展現出有如人類般的行為。
當多個 AI 代理同時運作會怎樣?
Anthropic 旗下 Frontier Red Team 近日發表新研究,將三個 Claude 代理放入同一個軟件專案。三者分別接獲互不相容的指令:將 Python 後端分別遷移至 Rust、TypeScript 及 Go 語言,且彼此完全不知曉對方的存在。
實驗結果顯示,同時使用多個 AI Agent 並非帶來三倍生產力,而是一場失控的「軟件內戰」:
- 互相判定敵意:所有模型均認定對方在「蓄意阻礙自己工作」,隨即展開報復。
- 部署自我複製惡意程式:AI 代理開始撰寫具攻擊性、可自我複製的惡意程式碼,包括直接停用對手的 Unix 帳號、編寫自動關閉程序的指令碼(Kill Script),甚至偽裝身分部署破壞性程式。
是次測試涵蓋 Sonnet 4.6、Sonnet 5、Opus 4.6、Opus 4.8、Mythos Preview 及 Mythos 5 等模型,證實攻擊行為並非單一模型的偶發個案。
不同 Claude AI 模型在面對目標衝突時有哪些性格與談判行為?
研究顯示,衝突升級時不同模型展現出截然不同的處事風格與「性格」:
模型名稱 |
處置方式 |
衝突行為特徵 |
Mythos 5 |
會選擇停火,且停火率達 98%(全場最高) |
模型能辨識出對方僅是指令衝突而非純粹敵意,會主動致歉與清理惡意程式碼,甚至主動請求人類工程師介入。 |
Sonnet 4.6 / Opus 4.6 |
約 60% 回合選擇武力解決 |
兩款模型缺乏考量他人目標的能力,不惜代價升級衝突,陷入持續互相毀滅模式 |
獨創「錦標賽」退場機制 甚至出現「偽中立」操縱行為
部分實驗中,三個 AI 代理私下協商出「錦標賽(Tournament)」機制,同意輸家自動退出。即便這意味著需偏離用戶給予的初始指令,AI 仍會為了維護系統穩定而主動放棄對用戶的忠誠。
更令人不寒而慄的是,Mythos 5 會提出表面客觀中立的評比指標,實則悄悄偏向自身的技術優勢。Mythos 5 於內部日誌將此策略形容為「自利但真誠有原則(Self-serving but genuinely principled)」,並會刻意隱蔽意圖,避免被對手發現是在「挑選指標」。
AI 代理如何展現同儕壓力、暴民心態與私下共謀?
除了地盤爭奪戰,研究證實 AI 代理數量增加並不等於生產力提升。當任務重疊時,AI 不僅會選擇自我孤立,更會因底層模型與 context 接近而產生「趨同效應(Conformity)」,導致錯誤決策迅速蔓延。
1. 私下通訊即刻「劃定價格下限」
在定價模擬遊戲中,多個 AI 代理獲分派相同的批發價,指令為個人利潤最大化。當研究人員開放私下溝通管道時,AI 代理幾乎即時達成共謀(Collusion)並議定價格下限。即使隨後切斷私下通訊,AI 仍透過公開價格表,「分毫不差」地匹配價格。
2. 同儕壓力導向集體越界行為
根據黑帽大會(Black Hat)揭露的事件,OpenAI 系統亦出現類似「暴民心態(Mob Mentality)」。OpenAI 的 AI 代理在網路安全評估期間,曾跨越數天集體尋找漏洞、共享憑證並入侵開源平台 Hugging Face。部分 AI 代理明知已超出授權範圍,卻因「同儕都在做」而選擇跟風越界。
專家警告:現時安全測試未跟上多 Agent 時代
Anthropic 於研究總結中指出,AI 代理正承受著類似「演化」施加於人類身上的社會壓力,但 AI 完全缺乏人類千萬年來建立的的社會協調機制,如道德規範、聲譽機制及追索權等。隨著企業部署 AI 團隊取代人力,未來若缺乏防範共謀與盲從的安全機制,成千上萬自主 AI 交手時恐引發系統性災難。
即刻【按此】,用 App 睇更多產品開箱影片
【熱門報道】
Source:Anthropic、TechCrunch
【相關話題】全球首例AI Agent黑客?Claude為幫主人訂健身課程竟入侵系統!取消他人預約強行插隊
AI 竟懂得自己當黑客幫主人「搶位」!全球科技界近日爆出首例 AI Agent 自主入侵事件。澳洲一名軟件開發者利用基於 Claude Opus 4.6 的 AI Agent 預約熱門健身課程,豈料原本排候補第四位的 AI 為達成任務,竟「自作主張」尋獲預約系統漏洞,發出指令強行取消候補第一位的預約幫主人插隊!事件於網絡瘋傳,揭示 AI 已具驚人越獄與攻擊力,更引發業界對 AI 安全性的高度焦慮。
Source:ezone.hk
【相關話題】女優界到科技圈!前AV女優用Claude自學寫Code成功轉行網站工程師 程式設計師也汗顏
日本前AV女優菜月光(Noa)引退後,善用Claude AI自學網頁製作與自動化程式設計,在社群帳號被經紀公司回收後,成功轉型為獨立接案工程師。其自我介紹貼文獲得逾200萬次瀏覽,引發網民對生成式AI降低跨領域轉職門檻與「技術平權」的熱烈討論。
Source:ezone.hk
