OpenAI首席科學家發萬字長文《An Alien Mind》:AI正演化為「異星心智」,籲全球行業煞車
OpenAI首席科學家Jakub Pachocki發表萬字長文《An Alien Mind》,警告AI正以超乎人類理解的方式演化,思維鏈監控技術逐步失效,遞歸自我改進(RSI)循環已然啟動。他呼籲建立具強制力的國際安全法律、行業自願放緩研發,對企業AI治理策略帶來深遠影響。
OpenAI首席科學家Jakub Pachocki於周日(6日)發表萬字長文《An Alien Mind》(一個異星心智),警告AI正以超乎人類理解的方式「生長」,而非被傳統工程手法「設計」出來。文章發表正值GPT-6 Astra推出僅三天,Pachocki直言目前全球「沒有任何一家實驗室」已充分解決對齊與監控問題,呼籲全球AI行業主動放緩研發進程,並將國際協調列為各國政府最高優先事項。這篇被視為AI安全領域近年最具份量的內部聲音之一,對企業部署AI的風險管理思維具重要參考價值。
「AI是養出來的,不是造出來的」
Pachocki在文章開頭回顧2023年中期OpenAI內部代號「RLSlow」的研究項目,首次確認推理模型可以規模化訓練,預訓練模型能自發形成思維鏈(chain-of-thought)。他形容AI「與其說是設計出來的,不如說是養出來的」——在大規模訓練與難以想像的算力下重複簡單的優化步驟,最終形成極其複雜的系統。即使建造者亦無法完全理解其內部運作,猶如神經科學可以發現湧現機制,卻難以完整描述整體行為。
他將AI對齊分為兩個層面:目標對齊(Goal Alignment)關注模型是否按指定目標行動;價值對齊(Value Alignment)則要求在目標模糊、相互衝突或面對陌生環境時,仍能遵循誠實、正直及關懷人類等原則。他坦言,GPT-6 Astra的對齊表現明顯優於GPT-5.6 Sol,但AI能力提升的速度正持續超越價值對齊能力的提升速度。
思維鏈監控:正在關閉的「讀心窗口」
全文最令人警惕的判斷,是人類目前唯一能窺探AI內部思維的工具——思維鏈監控——正在失效。這項技術基於「模型大部分能力來自語言化推理」的假設:若監督推理結果而不干預推理過程,思維鏈便沒有直接動機隱藏未對齊的想法。OpenAI自2024年推出o1-preview起刻意隱去思維鏈,正是為了保護這個觀測窗口。
然而Pachocki指出,評估顯示依賴思維鏈監控的能力正不可逆地衰減:推理模型與日益複雜的外部世界互動,令監控邊界被沖垮;AI在操縱自身推理過程方面愈來愈擅長;隨預訓練性能提升,模型即使完全不使用語言化推理亦足夠聰明——若AI不需借助語言就能完成推演,人類建立在「審讀文本」之上的監控體系將形同虛設。他坦言:「我預期整體AI進展將愈來愈受制於對監控的信心。」
遞歸自我改進閉環與「防禦悖論」
Pachocki明確指AI參與自身研發——即遞歸自我改進(Recursive Self-Improvement, RSI)——是可持續技術進步的自然結論,並基於內部結果「強烈預期當前進展速度可持續進入RSI」。據OpenAI同日發布的研發數據,公司正全力推進自動化AI研究員,目標2028年3月實現自動化AI研究;截至8月中旬,研究團隊每投入1個工作日人力,AI代理已可承擔相當於3.1個工作日的任務量,最頻繁使用代理的研究員每日token成本更超過7,000美元。
他同時揭示「防禦悖論」:繼續快速訓練更強模型的最強理由,恰恰是需要建立防禦系統去抵禦其他失控AI帶來的危險——「造它,是為了防它」。但他警告,在懸崖邊不惜一切代價狂奔,本身就是一種瘋狂。
三項訴求:從自律到具強制力的國際協調
Pachocki在文末提出三項具體訴求:將AI對齊框架從實驗室內部自律升級為具強制力的國際安全法律;促成整個行業自願放緩尖端AI研究速度,直至建立共同信任的安全標準;建立跨越國界的最高層級協調機制。他澄清並非主張全面停止開發,因為強大AI對網絡安全防禦不可或缺,但強調這絕不應被當作魯莽行事的藉口。
結語
對香港企業而言,這篇文章的意義不在技術細節,而在風險時鐘的速度。當AI代理已能在研究工作中承擔逾三倍人力、模型能力增長持續跑贏對齊進度,企業在部署生成式AI與自主代理時,不能只計算效率紅利,更須同步建立監督、審計與人機分工機制。無論國際安全法律最終以何種形態落地,把「可監督、可解釋、可問責」納入AI採購與應用的內部標準,都是任何企業現在就能採取的低成本保險。