皮爾斯·摩根 Piers Morgan大概沒有想過,有一天自己會在訪談現場,被一個人工智能女演員突然冒出的粵語問住。前十分鐘,她一切正常:標準英語,自然表情,知道什麼時候笑,也知道怎樣替自己的新電影做宣傳。直到英國老演員湯姆·康蒂Tom Conti 問了一個很普通的問題:電影里和你搭戲的那些演員,究竟是真人,還是電腦生成的?她回答到一半,停了一下,然後毫無預兆地開始說粵語。
演播室里的空氣像是突然斷了一拍。摩根沒聽懂,康蒂也沒聽懂。十幾秒以後,這個名叫蒂莉·諾伍德(Tilly Norwood)的人工智能“女演員”又切回英語,甚至帶著一點近乎真人的尷尬,解釋說自己剛才好像出了一個小故障,有時候“線路會串一下”。如果不是那十幾秒,整場采訪幾乎足以讓人忘記:坐在屏幕另一端接受采訪的,並不是一個真正出生、長大、生活過的人。
事情發生在2026年9月18日的《皮爾斯·摩根不受審查》。蒂莉當時正在宣傳自己參與的電影項目《錯位》(misaligned)。節目片段很快傳遍網絡,人們笑她“翻車”,猜測她後台接錯了什麼模型,也有人把那段粵語當成一個絕妙的技術段子。但真正值得注意的,並不是一個人工智能為什麼突然換了語言,而是那短短十幾秒讓我們第一次非常直觀地看到:當人工智能已經足夠像一個人時,我們究竟憑什麼相信,屏幕上的“她”從頭到尾都是同一個“她”?
很多人把它當成一個笑話。有人說人工智能“露餡”了,有人猜測後台是不是接到了某個中國大模型,還有人開玩笑說,白人模樣的人工智能女演員說著說著突然有了“廣東衛視的味道”。這些笑話當然很好玩,但如果只把這件事理解成一個語言程序故障,反而錯過了最有意思的地方。
蒂莉真正暴露的不是粵語,而是人格的接縫。
我們平時看一個真人演員接受采訪,很少意識到一件事:為什麼無論她說英語、法語還是粵語,我們仍然認為說話的是“同一個人”?因為真人擁有一個天然的人格錨點:身體。聲音屬於這個身體,記憶儲存在這個身體的大腦里,表情來自這個身體,童年屬於這個身體,昨天說過的話也由這個身體承擔。一個人即使突然換一種語言,甚至忘記昨天說過什麼,我們通常仍然不會懷疑:她還是不是剛才那個人?
人的人格天然具有連續性。人工智能沒有。所謂“蒂莉·諾伍德”,表面上看起來是一個漂亮的英國女孩,技術上卻是許多系統共同組成的結果。
而這次采訪尤其說明問題。媒體披露,接受采訪的並不是用於電影表演的那個“蒂莉”,而是“粒子6”公司專門開發的訪談版本“會說話的蒂莉”。這個版本由大語言模型驅動,背後有一份長達12頁的系統提示詞,用來規定她的性格、幽默方式和行為邊界,同時還有最多30份文件組成的知識庫,告訴她自己是誰、做過什麼、對哪些事情有什麼看法。也就是說,我們看到的那個似乎擁有自己性格的“女孩”,其“內心世界”的相當一部分,本質上是一份人格說明書加一個知識數據庫。
這恰恰是這次事故最值得思考的地方。過去我們討論人工智能,主要討論智能:它會不會寫文章,會不會編程,會不會診斷疾病,會不會取代律師、翻譯、會計和程序員?蒂莉·諾伍德帶來的問題已經向前走了一步。我們開始制造的,不再只是會完成任務的機器,而是能夠持續扮演“某個人”的機器。
這兩者完全不同。一個聊天機器人回答完一個問題,我們並不要求它明天還是“昨天那個人”。但一個演員、主播、網紅、虛擬伴侶,甚至未來的人工智能朋友不能如此。她必須記得昨天說過什麼,知道自己喜歡什麼電影,保持相似的價值判斷和幽默方式,甚至記得自己曾經討厭誰、愛過誰、害怕什麼。
換句話說,人工智能從“工具”走向“角色”之後,需要解決一個過去計算機科學很少面對的問題:怎樣制造一個連續的自我?
而這件事可能遠比制造聰明更難。聰明可以模塊化:語言模型負責聊天,視覺模型負責臉,語音模型負責聲音,動作模型負責身體,記憶系統負責過去,檢索系統負責事實,安全系統負責邊界。每一個部分都可以非常強。真正困難的是,當所有系統同時運行時,它們必須讓我們產生一個感覺:這些東西屬於同一個人。
蒂莉突然說粵語的那十幾秒,恰恰把這個感覺暫時打破了。我們突然意識到,屏幕上那個女孩並不是一個完整的人。她更像一支正在演奏交響樂的樂隊。只要視覺、聲音、語言、記憶、知識和人格設定保持同步,我們就聽見一首完整的曲子;只要其中一個聲部突然走調,我們立刻就會意識到,剛才那個所謂的“人”,其實是許多系統共同制造出來的效果。
這也解釋了為什麼這件事讓人覺得格外滑稽。如果一個法國演員突然說粵語,人們可能會驚訝:“原來她還會粵語。”可是蒂莉突然說粵語,人們第一反應卻是:系統壞了。
區別很微妙。我們願意把真人的異常解釋成能力,卻傾向於把人工智能的異常解釋成故障。原因就在於,我們還沒有真正相信它擁有一個“自我”。
更有意思的是,蒂莉自己把它稱為一次“小故障”,說自己的線路偶爾會串;“粒子6”公司隨後卻淡化“故障”的說法,認為這也顯示了她的多語言能力,並推測她可能誤聽到了粵語詞匯,於是切換了語言。這幾乎像一則人工智能時代的職場寓言:員工說,我好像出程序故障了;老板說,不,這是產品功能。
不過,公司怎麼解釋並不重要。真正重要的是,這次意外讓我們非常直觀地看到:所謂人工智能“人格”,已經開始成為一種可以工程化生產的東西。
12頁提示詞,30份背景文件,一些記憶,一個聲音,一張臉,一套幽默感,若干價值邊界,再加上一段虛構的成長經歷,把它們組合起來,一個“人”就出現了。
這里面藏著一個比“人工智能會不會搶演員飯碗”更大的產業變化。未來真正昂貴的人工智能產品,很可能不再只是模型,而是人格。模型越來越容易複製,算力越來越便宜,語言能力逐漸商品化,一個模型會說英語、中文、法語、日語,最終不會是什麼稀奇的能力。真正稀缺的東西可能變成:這個人工智能是誰。
它有沒有穩定的性格?有沒有幾十年的記憶?有沒有獨特的說話方式?有沒有別人無法輕易複製的人際關係?你是否已經和它共同生活了十年?它是否知道你的父親是誰,記得你的孩子小時候說過什麼,知道你三年前失戀時為什麼哭?
到了那一天,人工智能產業爭奪的就不只是“智能市場”,還會進入一個新的市場:身份市場。
這也是為什麼演員這個行業會比許多人想象得更早撞上這個問題。美國演員工會—美國電視和廣播藝人聯合會早在蒂莉引起關注時就明確反對把她稱為真正的演員,認為她是計算機生成的合成角色,並指出這種合成表演涉及真人演員作品的訓練、授權、報酬以及就業問題。
這場爭論當然涉及飯碗,但它最終會觸及一個更困難的問題:演員究竟是什麼?
如果演員只是提供一張臉、一種聲音和若干表情,那麼人工智能遲早能夠做到,而且成本會越來越低。如果演員真正提供的是人生經驗——一個人愛過、失敗過、衰老過、失去父母、養育孩子、被背叛、經歷羞恥以後沈澱在身體里的東西——那麼人工智能面對的問題就不再是畫面夠不夠逼真,而是一個沒有經歷過人生的系統,能不能真正擁有表演所需要的“內部歷史”。
“粒子6”公司自己其實已經意識到了這個問題。蒂莉的開發者曾表示,他們正在努力構造她的“內在世界”——人格、記憶和背景故事,希望讓這個角色在不同場景、不同時間里保持連續性。相關系統甚至專門強調,從一次出現到下一次出現,記憶和行為要保持一致。
這句話非常重要。因為人工智能競爭正在從一個時代進入另一個時代。第一階段比的是:誰更聰明。 第二階段可能比的是:誰更像一個持續存在的人。
這意味著未來判斷一個高級人工智能是否成功,也許不能只做圖靈測試,還需要另一種測試。我願意把它叫作:人格連續性測試。
今天的你和昨天的你是不是同一個你?十年後的你是否記得今天?換一個模型以後,你還是你嗎?服務器遷移以後,你還是你嗎?公司修改系統提示詞以後,你還是你嗎?如果一家公司把你的人工智能伴侶後台模型從甲模型換成乙模型,而它依舊擁有同樣的臉、聲音和記憶,你面對的究竟還是不是原來那個“人”?
這不是技術小問題。它會逐漸成為哲學問題、法律問題,甚至倫理問題。因為一旦人類開始與人工智能建立真正長期的感情,我們關心的就不會只是它今天回答得準不準,而會關心一個過去只有人才需要面對的問題:你還是不是從前那個你?
所以,蒂莉·諾伍德那十幾秒粵語真正有意思的地方,並不在於它證明了什麼“西方的殼子里藏著中國的內核”。那個說法很有傳播力,卻把問題說小了。真正暴露出來的是另一件事:人類已經不滿足於制造智能,我們開始制造人格。
臉可以生成,聲音可以複製,記憶可以寫入,性格可以設定,過去甚至也可以編造。只要這些東西運行得足夠協調,一個從未出生過的人就可以坐在電視演播室里,接受采訪,談自己的電影,開自己的玩笑,讓觀眾在不知不覺中使用“她”來稱呼它。直到其中一個模塊偏離軌道,我們才突然想起:這個“她”其實是被許多系統臨時維持起來的。
所以那十幾秒最值得記住的,不是一個英國女孩模樣的人工智能突然說出了粵語,而是那一刻,我們短暫地看見了“她”背後的結構。像舞台幕布被風吹開一道縫,演員仍然站在那里,布景卻露出了後面的鋼架。人工智能沒有因此變得更不像人,它只是讓我們看見了一個人工人格必須怎樣努力,才能持續像一個人。
過去二十年,我們反覆追問:機器什麼時候會像人一樣聰明? 接下來也許會出現一個更麻煩的問題:當機器已經能夠扮演一個人,我們靠什麼確認,今天的它和明天的它仍然是同一個“它”? 如果臉可以換,聲音可以換,底層模型可以換,服務器可以換,記憶也可以遷移,那麼一個人工智能的“自我”究竟存在於哪里?
這也許才是人工智能時代真正困難的工程。制造智能,最終可能只是讓機器知道得更多、算得更快、回答得更好;制造一個“我”,卻意味著讓無數可以替換的零件之間,維持一種不可輕易替換的連續性。未來最稀缺的也許不是更聰明的機器,而是一個能夠讓我們相信:昨天是它,今天還是它,明天依然是它的“人”。
轉載自《中國AI評論》
















