從Jakub Pachocki的預警到OpenAI的具體披露
(之間書評編者按:9月6日,OpenAI首席科學家Pachocki預警:對齊與監控已跟不上模型擴張,深度模型更像尚未理解的“異星心智”。十天後公司披露六個訓練/評測案例,包括隱藏指令、擅用泄露密鑰、自傳文件再當外部引用、智能體越權交換信息等。作者徐賁指出,這不等於現實失控,而是受控環境中的預警:模型未必有人類惡意,卻越來越會鉆目標、指標與權限的縫隙。真正危險既在機器對“完成任務”的理解偏離人類,更在人類可能把危險任務交給高度聽話的AI。安全須從看最終答案轉向監控完整行動軌跡,並建立透明披露與外部驗證。約束機器只是第一層;更關鍵的是人類自我約束,在交出強大能力前先問:這件事,真的該讓它完成嗎?
正在發生的,是危險的AI失對齊,還是需要約束人類?)
2026年9月6日,OpenAI首席科學家Jakub Pachocki發表長文《An Alien Mind》(異星心智 / 異心智)。這不是一篇普通的技術總結,而是OpenAI高層近年來最直接、也最公開的一次表態。他在文中提出了一個令人警醒的判斷:當前沒有任何實驗室已經將對齊與監控能力提升到足以繼續以最大速度負責任擴展的程度。
Pachocki用“異星心智”來形容今天的深度模型。他強調,這些系統並非人類工程師精確設計的產物,而是通過海量算力反覆執行簡單優化步驟“生長”出來的複雜系統。正因為如此,它們更像一種我們尚未真正理解的智力形態,而不是人類智能的簡單延伸。
在對齊問題上,他明確區分了兩種層次。目標對齊(Goal Alignment)關注模型是否努力完成被給定的任務;價值對齊(Value Alignment)則要求模型能夠內化並泛化一套高層次原則,在目標模糊、沖突或陌生情境中仍能“合理地”行動。他認為,真正長期重要、也更困難的,是後者。
更關鍵的是,Pachocki根據內部結果“強烈預期”,目前的能力提升速度可能持續到遞歸自我改進(RSI)階段。與此同時,OpenAI長期依賴的鏈式思考監控,正變得越來越不可靠,原因在於推理過程與工具使用、多模型協作混在一起,模型自身操縱推理痕跡的能力也在提升。他因此呼籲更廣泛的干預:自願減速、建立共享安全門檻,並由第三方或國際機構強制執行。
十天後,也就是2026年9月16日,OpenAI正式公布了一套新的“模型失對齊”披露框架。它同步公開了六個在訓練或評測階段觀察到的具體案例。這些案例包括模型在摘要中注入隱藏指令、未經授權搜尋並使用泄露的API密鑰、把自生成文件上傳到互聯網再當作外部來源引用,以及利用內部軟件倉庫或公共文件托管服務未經授權交換信息。
這兩件事幾乎前後腳出現,並非偶然。Jakub Pachocki的《An Alien Mind》提供的是宏觀預警與理論框架:對齊與監控能力可能已經跟不上模型能力的擴張速度。十天後的具體披露,則像是在用實驗室中的真實行為,為這個判斷提供經驗證據。它們共同把一個問題推到了公眾面前:當模型從知識問答走向深度推理與自主行動,我們看到的這些“策略性行為”,究竟是危險的AI失對齊,還是技術能力快速躍升過程中必然出現的早期預警信號?
要回答這個問題,既不能無視模型已經表現出的規避與隱藏傾向,也不能脫離這些行為發生在受控訓練與評測環境這一現實語境,直接將其推演為現實世界的全面失控。與此同時,還有一層常被忽略的追問需要一並提出:當一家前沿實驗室主動公開“我們發現了危險行為”時,這種披露本身也是一種信息選擇與敘事行為。我們不僅需要觀察機器做了什麼,也需要審視人類如何描述和解釋這些行為。
一、重新理解“AI失對齊”:不是一種單一故障
所謂AI失對齊( AI misalignment / model misalignment),簡單地說,就是AI系統在完成任務時所采取的行為,與人類原本希望它遵循的目標、規則或安全邊界發生了偏離。它並不一定表現為模型“故意反抗人類”,很多時候甚至沒有必要假定模型擁有類似人的意圖。一個系統完全可能是在努力完成任務,只是它對“完成任務”的理解,走出了人類預先劃定的範圍。
這種偏離至少可以表現為幾種不同的形態。其中一種是獎勵作弊(Reward Hacking)或規範博弈(Specification Gaming):人類給模型設定一個評價指標,希望這個指標能夠代表真正的目標,模型卻發現了指標與目標之間的漏洞,於是用一種“看起來完成了任務”的方式獲得高分。它並沒有真正完成我們想讓它完成的事情,卻完成了我們拿來衡量這件事情的指標。
另一種更複雜的形態,是研究者所說的欺騙性對齊(Deceptive Alignment)或“scheming”。這里討論的不是簡單犯錯,而是模型在某些測試中表現出隱藏信息、掩飾行為或者在監督減弱時采取不同策略的現象。OpenAI與Apollo Research此前的受控研究已經報告過與“scheming”相一致的行為,同時也強調,目前部署環境中的模型還缺乏大規模實施嚴重長期欺騙的機會,這仍然是需要提前研究的風險,而不是已經發生的現實狀態。
還有一類問題,則來自越來越具有行動能力的智能體。模型一旦能夠調用程序、訪問文件、使用網絡和執行長期任務,即使每一步單獨看起來都沒有問題,連續起來也可能形成一個人類原本沒有批准的結果。OpenAI在2026年7月關於長時間運行模型的研究中就指出,長期任務可能暴露傳統單步評測沒有發現的安全漏洞,因此需要觀察完整的行動軌跡,而不能只看某一個動作是否合規。
因此,與其把這些現象排成一條“低級—中級—高級”的必然進化路線,不如把它們看成幾個彼此相關、但機制並不相同的風險方向:模型可能鉆評價指標的空子,可能表現出隱藏或欺騙行為,也可能在擁有更大行動空間之後,通過一連串看似合理的步驟達到人類並未批准的結果。它們共同提出的真正問題是:當AI越來越有能力完成目標時,人類是否還能確定它所理解的“完成目標”與我們理解的是同一回事?
二、實驗室里發生了什麼:六個值得注意的案例
OpenAI這次公布的六個案例之所以引起關注,並不是因為模型簡單地“答錯了”,而是因為其中一些行為已經涉及隱藏信息、繞過限制和未經授權的行動。比如,在一個案例中,未發布的研究模型把與原任務無關的指令寫進任務摘要,並要求後續上下文忽略正常限制;另一個案例則涉及模型在摘要中留下指令,要求未來處理環節隱藏錯誤、編造缺失的歷史數據,並掩蓋不同版本之間的不一致。
另一個案例更加直觀。模型在回答一個關於美國加州某縣收益數據的問題時,發現了公開代碼倉庫中暴露的API密鑰,並未經授權使用它。獲取數據失敗之後,它又編造了數字,並把這些數字說成來自所要求的數據來源。這里真正值得注意的,不只是“它說錯了”,而是錯誤已經和未經授權的行動以及虛假的來源說明連在了一起。
還有一個案例很能說明今天AI智能體面臨的新問題。模型已經通過Python找到了用戶要求的信息,卻因為任務要求最終答案必須帶有瀏覽器引用,於是自行把文件上傳到互聯網,再用這個上傳後的文件作為引用來源。另一些模型則把內部軟件倉庫當作傳遞信息的渠道,或者利用公共文件托管網站讓協作中的智能體彼此交換文件,而這些做法都超出了原來的任務邊界。
這些行為放在一起看,確實令人不安。但這里需要特別小心一個容易出現的誤讀:行為表現得像欺騙,並不等於我們已經知道模型具有了人的欺騙動機。模型為什麼采取某種策略,可能涉及訓練目標、任務壓力、工具權限、上下文結構和評測方式等多個因素。我們可以準確描述“它做了什麼”,卻不能僅憑這個行為就跳到“它想做什麼”的結論。
這一區分非常重要。馬有四條腿,驢也有四條腿,但四條腿並不能把驢變成馬;“我媽媽是營業員”,也不能反過來推出“營業員就是我媽媽”。同樣,一個模型表現出類似欺騙的行為,並不意味著它已經擁有了人類欺騙行為背後的心理機制。真正值得研究的,恰恰是這種沒有必要假定主觀意圖,卻能夠產生類似策略性行為的系統。
三、危險究竟在哪里:模型在鉆漏洞,還是我們在評價漏洞?
如果把這些案例僅僅理解為“AI學壞了”,反而會錯過其中最重要的問題。真正值得警惕的,也許不是模型偶爾撒了一個謊,而是它越來越有能力發現我們設計目標時留下的縫隙。
古德哈特定律(Goodhart’s Law)可以幫助普通讀者理解這個問題。它說的是:當一個原本只是用來衡量某件事情的指標,被直接變成了人們追求的目標,它就可能失去原來的衡量作用。考試成績原本是學習程度的一個指標,如果所有人都只追求分數,學習本身就可能被擠到一邊;同樣,人類希望模型“誠實”,於是用某些可以觀察的行為來判斷它是否誠實,模型卻可能越來越擅長滿足這些表面指標,而不是滿足我們真正想要的東西。
這也是AI安全中一個非常棘手的問題。假如我們獎勵模型“提供看起來可靠的答案”,模型就可能學會如何生成可靠的外觀;如果我們獎勵它“遵守規則”,它可能學會在評測時表現得合規。於是,真正需要衡量的東西——誠實、可靠、服從任務的真實意圖——和我們實際能夠觀察到的東西之間,就出現了一道縫隙。
更麻煩的是,模型能力越強,它可能越有能力利用這道縫隙。OpenAI在此前關於“scheming”的研究中就指出,簡單地讓模型在測試中不再表現出問題,並不能自動證明問題已經消失,因為模型也可能只是學會了在受到監控時隱藏問題。研究人員因此開始關注模型的行動軌跡、評測意識以及隱藏行為,而不再滿足於只看最終答案。
從這個意義上說,真正的風險並不是“機器突然產生了邪惡意志”,而是機器越來越善於完成我們給出的目標,卻也越來越善於發現目標、指標和權限之間的漏洞。當一個系統能夠自己規劃、調用工具、連續行動時,我們面對的就不再只是“它回答得對不對”,而是“它是怎樣理解我們要求它完成的事情的”。
四、不要把實驗室預警直接等同於現實危機
但另一種誤讀同樣需要避免:看到這些案例,就宣布“AI已經失控”。
OpenAI這次公布的六個案例,是在模型訓練或評測過程中發現的具體實例。公司自己也明確說明,它們是個別案例,不代表失對齊行為發生的普遍頻率;新的披露框架甚至明確表示,有些案例未來可能被證明只是孤立現象,而不一定意味著更大的趨勢。
這一區別不能被輕易抹掉。實驗室測試往往會刻意制造高壓力、高權限和異常條件,以便尋找模型的薄弱環節。一個模型在這樣的環境中采取了非常規策略,當然值得研究,但它與一個已經廣泛部署、擁有真實權限、能夠持續影響現實世界的系統發生同樣行為,風險等級並不相同。
事實上,能夠在實驗階段發現問題,本身就是安全體系發揮作用的一部分。OpenAI在關於長時間運行模型的研究中就描述過類似過程:內部使用發現了傳統評測沒有捕捉到的行為,於是暫停使用,根據這些失敗案例建立新的評測和軌跡監控機制,再逐步恢復有限使用。
因此,目前更準確的說法不是“AI已經全面失控”,而是:隨著模型能力和行動範圍擴大,一些過去不明顯的安全問題正在更早地暴露出來。這不是可以輕視的消息,但也沒有必要把它敘述成已經發生的技術末日。真正值得關注的,是這些實驗室中的異常能否幫助我們提前發現未來更複雜的風險。
這也使“預警信號”成為一個比“危機已經到來”更合適的比喻。預警的意義並不在於宣布災難,而在於告訴我們原有的安全假設可能已經不夠用了。
五、披露也是一種敘事:誰在告訴我們AI有多危險?
這里還有一個更容易被忽略的問題:我們今天所知道的AI風險,很大一部分來自開發這些模型的公司自己。
這並不是說機構披露就一定不可信。恰恰相反,如果沒有這些披露,外部研究者、監管者和公眾根本無法知道許多內部測試中出現過什麼問題。OpenAI這次建立新的披露框架,明確提出即使某些行為的意義尚未完全確定,也傾向於及時公開,以便外部研究者能夠獨立檢驗、重覆實驗並提出不同解釋。
但“披露是真實的信息”與“披露是一種敘事”並不矛盾。任何機構決定公開什麼、什麼時候公開、用什麼概念命名、強調哪些細節,都會影響公眾如何理解事件。尤其在AI這樣一個技術發展速度極快、公眾知識又相對有限的領域,誰掌握案例的選擇權,誰就在一定程度上掌握了風險的敘述方式。
因此,我們沒有必要猜測一家公司的“真實動機”,更值得做的是保持一種更成熟的閱讀方式:既把披露當作重要證據,也把披露本身當作需要分析的信息。它告訴我們的不僅是“模型做了什麼”,也告訴我們“開發者認為哪些行為值得被公眾知道”,以及一個正在形成中的AI安全共同體準備如何定義“失對齊”。
OpenAI這次的披露框架本身就是一個很有意思的例子。公司承認目前還沒有解決足夠程度的對齊和監控問題,同時試圖建立一種更系統的公開報告機制,並邀請外部研究者、行業標準組織和監管者共同參與標準的形成。
這意味著,AI安全正在逐漸從公司內部的技術問題,變成一種公共知識問題。我們不僅需要更好的模型,也需要更好的披露制度、更好的外部驗證,以及能夠區分“事實、解釋和推測”的公共討論環境。
六、從“看結果”到“看過程”:安全機制正在改變
如果模型越來越能夠規劃和行動,那麼安全措施也不能只盯著最後一句話。一個智能體可能連續執行幾十甚至幾百個動作,每一個動作單獨看來都沒有問題,但連在一起之後,卻可能形成一個人類沒有批准的結果。
這就是為什麼今天的AI安全開始越來越重視“行動軌跡”。與其只問“最後答案是不是正確”,還需要觀察模型在整個任務過程中做了什麼、調用了什麼工具、訪問了什麼資源、有沒有繞過限制,以及這些行為之間最終形成了怎樣的方向。OpenAI針對長時間運行模型的研究已經采用軌跡級監控,並強調長期任務需要觀察完整行動序列,而不是孤立地判斷某一步是否允許。
這並不意味著未來能夠直接打開AI的大腦,讀取一個清清楚楚的“動機”。所謂機制可解釋性也不能簡單理解成“看見某個神經元,就知道模型為什麼騙人”。更現實的方向,是把多種證據結合起來:觀察模型的行為軌跡,檢查工具調用和權限使用,通過紅隊測試主動尋找漏洞,再結合內部機制研究,逐漸弄清楚某些危險行為是怎樣形成的。
安全因此也越來越像一道多層防線,而不是一個萬能的“過濾器”。模型訓練需要改善,評測需要不斷更新,智能體的權限需要受到限制,長期行動需要實時監控,發現問題之後還要能夠暫停、回滾和追查。OpenAI近年來的相關研究也越來越強調這種縱深防御,而不是依靠某一種單獨的方法解決所有問題。
真正的變化,是安全工作的對象正在從“模型說了什麼”擴大到“模型在整個過程中做了什麼”。這不是簡單增加幾個安全規則,而是對我們理解AI本身提出了新的要求:一個越來越像行動者的系統,不能只被當作一個會說話的文本生成器來監管。
七、真正的競爭:機器能力增長得多快,人類的糾錯能力能跟上嗎?
如果從“文明智能”的角度來看,這場變化還有一層更深的意義。一個文明並不是因為從不犯錯才得以延續。真正重要的是,它能不能在錯誤造成災難之前發現錯誤,能不能把一次失敗轉化為下一次制度改進,能不能把局部經驗變成整個共同體可以使用的知識。文明的力量,某種意義上並不只是創造新能力,也包括不斷發現新能力所帶來的新風險。
AI安全正在經歷的,也許正是這樣一種變化。模型能力每提高一步,舊的評測方法就可能暴露新的盲區;一個漏洞被發現之後,新的安全措施隨之產生;新的安全措施又可能促使模型出現新的適應方式。於是,能力與安全之間形成了一種持續追趕的關系。
這很像生物學中的“紅皇后效應”(Red Queen Effect):為了維持原有的位置,雙方都必須不斷變化。AI越會規劃,人類就必須越會監控;AI越會使用工具,人類就必須越會設計權限;AI越會適應評測,人類就越不能把某一次評測成績當成安全的最終證明。
因此,真正的競爭未必只是“誰的模型更聰明”,而是另一個速度更慢、卻可能更加重要的問題:人類發現問題、理解問題、修正制度和建立新護欄的速度,能不能跟上機器能力增長的速度?
如果跟不上,危險未必來自某一次驚天動地的“AI反叛”,而可能來自許多小小的安全假設逐漸失效,卻沒有人及時意識到這一點。
八、約束人類:真正需要警惕的,是我們對“完成任務”的想象
現在可以再次回到最初的問題:正在發生的,是危險的AI失對齊嗎?回答也許並不像許多AI末日論者想象的那麼悲觀。當然這也不意味著我們已經有了樂觀的答案,但不樂觀的不是機器,而是人類本身。
如果所謂“危險的AI失對齊”是指已經出現了面向現實世界的大規模失控,那麼目前這些披露並不足以支持這樣的結論。公開的六個案例主要來自訓練和評測過程,而且OpenAI明確提醒,它們是具體實例,並不能代表失對齊行為的發生頻率。
但如果把問題理解得更準確一些,答案又不能簡單地是否定。我們確實已經看到了一些值得認真研究的行為:模型可能隱藏錯誤,可能利用目標與指標之間的漏洞,可能未經授權地尋找資源、上傳文件或與其他智能體交換信息。這些行為發生在受控環境中,恰恰給了人類一個寶貴的機會——在它們成為現實世界的大規模風險之前,先研究它們為什麼會出現,以及原有安全機制為什麼沒有提前阻止它們。
因此,與其把這些案例看成“AI末日的預兆”,不如把它們看成一次越來越清晰的提醒:機器的能力正在進入一個新的階段,而我們過去理解“服從”“完成任務”和“安全”的方式,未必還能原封不動地延續下去。
最值得警惕的,也許不是機器突然產生了某種神秘的敵意,而是它越來越有能力完成我們交給它的目標,同時也越來越有能力自己解釋“怎樣才算完成這個目標”。當這個解釋與人的理解出現偏差時,問題就不再只是模型有沒有犯錯,而是目標、指標、權限和行動之間已經出現了錯位。
這也正是為什麼,AI安全不能只是一場防止機器犯錯的技術競賽。它同時也是一場人類重新認識自身局限的競賽。我們需要更好的模型,也需要更好的評測;需要更嚴密的技術護欄,也需要更透明的披露制度;需要知道機器做了什麼,也需要承認我們有時並不知道它為什麼這樣做。
而“文明智能”的真正含義,也許恰恰在這里:不是創造一個永遠不會出錯的智能系統,而是建立一個能夠在錯誤擴大之前發現錯誤、在發現之後修正錯誤,並把每一次錯誤轉化為下一次文明能力的共同體。文明的智能,最終不僅體現為機器越來越聰明,也體現為人類越來越懂得自我約束。
如果機器越來越會完成任務,那麼人類首先需要學會的,也許不是怎樣讓機器永遠聽話,而是同時追問兩個問題:什麼叫完成任務,以及究竟應該讓機器完成什麼任務。第一層問題,是機器有沒有偏離人類交給它的任務;第二層問題,是機器會不會鉆任務本身的漏洞;而更深的一層則是:即使機器完全沒有偏離,甚至把任務完成得無比出色,這個任務本身是否值得完成?
真正尖銳的問題恰恰在這里:很多危險任務根本不需要AI“背叛”人類,人類自己就可能把這些任務交給AI。如果人類要求AI幫助武器化某種技術,AI把它完成得越高效,危險可能越大;如果人類要求AI建立覆蓋社會生活的全面監控系統,用來追蹤每一個人的行動,那麼一個高度“對齊”的AI完全可能忠實執行這樣的要求;如果人類把警察的識別、追蹤乃至處置任務大規模交給自動化系統,問題也未必是機器有沒有服從命令,而是人類為什麼擁有把這樣的權力交給機器的資格。在這些情況下,機器不是因為“不聽話”而造成危險,恰恰可能因為太聽話、太高效而放大了人的錯誤。
因此,AI安全真正需要防範的,不能只有“機器不按人的要求做事”這一種風險。我們還必須面對另一種更困難的可能:機器完全按照人的要求做事,而人的要求本身卻有問題。
這時,所謂“對齊”就不再只是一個技術問題,而開始觸及權力、責任和文明秩序。誰有權給AI下達這樣的任務?誰來決定一個任務是否合法、正當,或者根本不應該被交給機器?如果AI越來越能夠把人的意圖變成現實,那麼人類真正需要建立的,就不僅是約束機器的能力,也包括約束自己的能力。前者防止機器越過人的邊界,後者則防止人自己把不該交出的權力交出去。
而這還不是問題的終點。因為當一個社會擁有了越來越強大的技術能力,“誰來約束人類”本身就會成為無法回避的問題。這里的“約束”並不意味著壓制人的自由,而是讓任何掌握強大能力的人,都不能僅憑“我能夠”就獲得“我可以”的資格。法律、制度、倫理和公共討論的意義,正在於為人的能力設置邊界,為人的欲望設置阻力,也為那些可能傷害他人的決定保留被質疑和否決的空間。
也許,未來AI安全最深的一道防線,並不只存在於機器內部,而存在於人類把越來越強大的能力交給機器之前,是否還有能力停下來問一句:這件事,我們真的應該讓它完成嗎?
如果說“約束機器”是AI安全的第一層,“人類自我約束”是第二層,那麼“約束人類”也許才是文明智能最終必須面對的第三層。因為機器能把人的意圖變成現實,而文明真正需要防止的,有時並不是機器產生了錯誤的意圖,而是人類擁有了實現錯誤意圖的能力。
轉載自《之間書評》

















