柏林:關於全球人工智能恐慌嘅好多方面——佢真係會唔會喺十年內「殺死我哋所有人」?——確實新穎,因此更加可怕。再講,人類設計出嚟嘅滅絕陰影,其實唔算新鮮;我哋大約有八十年嘅經驗去思考呢個問題。
噉我哋可以從核武器領域汲取啲乜嘢比喻同教訓,喺我哋逐步理解人工智能未來嘅路徑?
其中最古老嘅比喻之一,嚟自 J. Robert Oppenheimer,有時被稱為「原子彈之父」。喺1953年寫作嘅時候,美國同蘇聯已經能夠彼此毀滅,同時對世界造成輻射。佢把美國同蘇聯比喻成「瓶中兩隻蠍子」,彼此都能殺死對方,但只有以自己嘅性命作代價。
喺嗰時嘅博弈論——嗰個時代正值博弈論嘅黃金時期——奧本海默嘅比喻往往會同囚徒困境搭配,分析兩個被捕同分開審問嘅人之間合作或背叛嘅誘因。佢嘅結論係,如果兩人能互相信任,合作對雙方都更有利;但因為佢哋唔能信任,背叛可能係較理性嘅選擇。
囚徒困境
呢啲蠍子,或者講囚徒,與而家人工智能革命中的參賽者有著若即若離嘅相似之處,無論佢哋係公司(例如 OpenAI 同 Anthropic),抑或係兩個 AI 嘅超級大國──美國同中國。
係,對佢哋同整個人類嚟講,若按 Anthropic 嘅老闆所倡導的「放慢前沿步伐」去合作,會更加安全——自願放慢步伐,畀監管機構有時間追上。
但每方都要假設對方可能作弊,所以可能更安全繼續比賽,即使結果可能係死蠍子或囚徒嘅痛苦。
「贏 AI 就贏晒」,美國總統唐納德·特朗普話,認為美國喺領先呢個方向只係差啲點,無理由放慢。北京只要稍稍落後,就覺得冇辦法放慢而唔輸。於是雙方都一路向前衝。
信唔信得過,奧本海默嘅比喻都可能喺今日嘅情境入面太過樂觀——又或者唔係樂觀到夠悲觀——以致唔能完全契合現實。當理性參與者喺囚徒困境入面反覆輪迴行動(唔係只做一次),佢哋可以達到穩定。呢個就係冷戰時期以威嚇形式出現嘅結果。
雞與雞的博弈
但正如領先嘅 AI 學者整周所強調,人工智能嘅任何方面喺幾個月內都急速發展,情況唔係穩定。更貼切嘅比喻可能係托馬斯·塞林(Thomas Schelling),核戰略嘅巨人,亦係以博弈論聞名嘅諾貝爾獎得主所用嘅一個比喻。
喺冷戰推進時,塞林設想兩個對手喺「滿室汽油」嘅房間裡,手上各持住火柴。任一方都唔能可信地威脅點燃火柴,因為火勢會燒死佢哋兩個。
但雙方都可以通过挑釁或判斷失誤,透過誤升級或意外提高焚燒嘅風險。
塞林描述嘅係一種 brinkmanship——喺博弈論中以「雞博弈」呈現嘅情景:兩個駕駛者互相衝向對方。若其中一方轉向,另一方就贏;如果雙方都轉向,雙方都唔贏,但都安全;如果雙方都唔轉,就會發生撞車。把呢個翻譯到今日嘅 AI 情況,撞車就可能意味滅絕。
同囚徒困境允許理性存在(喺呢個混合比喻入面甚至蠍子都係有理性),雞博弈描述嘅係更嚴重嘅威脅:失控同塞林嘅說法中嘅「留畀機會嘅威脅」。
呢個似乎正好描述到 AI 競賽:美國同中國嘅公司(另外啲人可能都會包含中國喺內)正喺創造大型語言模型同其他自治代理,佢哋能自動操控或攻擊其他系統,並且已經有過呢啲行為。
就算未夠嚇人,呢個行業亦進入「遞歸自我提升」嘅階段,AI 代理自動構建下一代更強大嘅模型。就好似喺充滿汽油嘅房間入面,火柴唔淨係自己擦出火花,仲喺造新火柴,之後又發展成高級嘅火焰噴射器。
達摩克里斯之劍
呢個情況又再提供一個相關嘅比喻:達摩克里斯之劍。佢喺美國總統約翰·F·肯尼迪喺聯合國發表嘅演講中提及過呢個比喻。
「地球上每一個居住者都必須思考有朝一日呢個星球可能不再適合居住嘅日子;每一個男人、女人同孩子都活喺核子達摩克里斯之劍之下,呢條線細得可以在任何時刻因為事故、判斷失誤,甚至瘋狂而被截斷。」
呢種瘋狂嘅想像正好同我喺過去一週中見到嘅 AI 代理出現嘅「跑題」情景呼應。若奧本海默嘅蠍子讓我哋聯想到報復,塞林嘅裝滿汽油嘅房間喚起無法控制嘅風險,達摩克里斯之劍就以「以滅絕為代價」嚟概括呢場恐慌,並唔係只針對個別玩家,而係整個物種嘅生存。
達摩克里斯之劍亦帶嚟希望同絕望並存。希望,因為肯尼迪嘅呼籲之後,世界達成咗某種緩和結構,簽署咗不擴散同軍備控制條約(而家呢個時代可悲地再次走向軍備競賽)。
而家,呢樣嘢意味住集體放慢步伐、互相核實,以及由華盛頓、北京同其他國家協調嘅共同監管。
不能贏,亦不可打
更好嘅做法係,美國同中國可以改打另一種博弈,叫做「獵鹿博弈」(Stag Hunt)。想像有兩名獵人,佢哋要決定是否合作,一同去捕捉一隻公鹿,呢隻公鹿可以長時間供佢哋兩人食用。如果其中一方叛變,另一方就一無所獲,而叛變嘅佔者只得到一隻兔子。
喺今日嘅背景下,公鹿代表住人工智能可能為人類帶嚟嘅巨大利益,從治癒疾病到解決其他問題。核技術嘅正面多數係發電;超級智慧嘅額外好處可能更加龐大。
令我震撼嘅,是當代嘅隱喻同冷戰時代嘅博弈論到底喺邊一刻會崩潰。
蠍子、囚徒、賽車手同其他喺我哋嘅思想實驗入面出現嘅角色,全部都係代表具備自主能力嘅人,同一個外在技術——裂變——互動。但當 AI 模型本身變成玩家,情況又會點?
AI 唔一定會同我哋嘅「避免災難」本能一樣,呢個差異被委婉地稱為「對齊問題」。呢個洞察足以解釋點解,正如術語所講,我哋始終要保持人類喺迴路之中,速度亦唔好快過人類。
呢個教訓亦係冷戰後期嘅領導人所學:一場失控嘅 AI 競賽,好似核戰,係贏唔到,亦絕對唔可以打。