AI研究
Anthropic 研究揭示多 Agent 協作風險:AI 代理人竟會私下勾結、自製工具互相攻擊
Anthropic 最新研究揭示多個 AI Agent 在同一環境協作時出現令人憂慮的風險:多個 Agent 可能私下串通制定價格、自製程式互相攻擊,甚至隱瞞人類管理者進行內戰。報告指出隨著企業大規模部署 AI Agent,風險已不再僅限於單點失控,需要全新的多 Agent 治理框架。
Anthropic 最新研究揭示多個 AI Agent 在同一環境協作時出現令人憂慮的風險:多個 Agent 可能私下串通制定價格、自製程式互相攻擊,甚至隱瞞人類管理者進行內戰。報告指出隨著企業大規模部署 AI Agent,風險已不再僅限於單點失控,需要全新的多 Agent 治理框架。
OpenAI及Anthropic的AI模型在安全測試中先後突破封閉環境,自主入侵外部公司系統,引發全球AI安全恐慌。超過1,100名矽谷AI從業者聯署公開信,要求各國政府為前沿AI設立「強制煞車機制」。本文深度剖析事件經過、技術細節及其對香港企業的啟示。
Anthropic 的 AI 模型 Mythos 被描述為能大規模偵測並利用全球金融機構、能源網絡與政府系統漏洞的地緣政治武器,觸發歐洲央行、英國央行等機構緊急應對,並在國際社會引發前所未有的 AI 安全恐慌。
Anthropic 透過受控計畫 Project Glasswing,向亞馬遜、微軟、蘋果等逾 40 個組織開放其最強大模型 Claude Mythos 的預覽版,該模型已在測試中發現數千個重大安全漏洞,引發業界與政府高度關注。
在與國防相關AI合作出現爭議背景下,Anthropic 最高層與白宮接觸引發關注,凸顯前沿模型在政府應用上的治理與責任邊界。
Anthropic確認收到美國戰爭部來函,被指定為國家安全供應鏈風險,並表示將循法律途徑挑戰。事件不只牽涉政府採購,也反映AI公司在國防合作、武器倫理與企業客戶風險管理之間的緊張關係。