中國研究人員規劃五階段計畫,讓人工智能在無需人類干預下自我提升

2026 年 9 月 21 日

來自中國領先大學同科技巨頭嘅研究人員而家正把目光投向同美國喺人工智能競賽中嘅一個關鍵新前線:研究能夠喺冇人類介入嘅情況下自行打造更好版本嘅系統。

喺週四(9月17日)發表嘅一份聯合論文中,字節跳動、清華大學同上海人工智能實驗室等機構嘅研究人員,提出咗一個遞歸自我提升(RSI)嘅五階段路線圖。

呢份題為《人類打造嘅最後一個 AI:邁向真正嘅遞歸自我提升》嘅研究,強調行業正日益聚焦於自動化訓練、評估同微調 AI 模型嘅繁重生命周期。

論文描述咗五個自主性逐步提升嘅階段。喺最初嘅階段,AI 只係執行由人類工程師設計嘅改進程序。佢之後開始自行決定點樣升級自己,而唔係單靠事先編好嘅指令。

喺後期階段,呢個系統會決定自己需要掌握啲咩新資訊或經驗,並喺部署之後適應變化。最終階段則會讓 AI 能持續精煉用嚟改進 AI 自身嘅方法。

同改正單一回應嘅聊天機械人唔同,RSI 需要改進能夠喺超越單一任務時持續存在,並喺繼任嘅系統中被繼承。

作者認為,能自動化部分 AI 研究嘅能力,未來可能成為模型開發者嘅一個競爭優勢來源。

如果呢個新範式能實現,作者表示佢可以縮短開發週期,同時大幅削減建立基礎模型所需嘅人力與計算成本。

自動化 AI 研究已經成為美中科技競爭嘅核心戰場。雖然中國機構繼續取得快速嘅實際突破,但專家指出美國公司仍保持領先,原因主要係佢哋更易接觸到充足嘅計算資源。

「美國公司睇落仍比中國領先幾個月,且可用嘅部署算力較多,」人工智能政策與策略研究所嘅高級研究員Erich Grunewald表示。「中國研究人員喺用有限硬件挖掘出更高嘅性能方面非常有能力,但計算資源嘅限制確實都有限制。」

雖然前路充滿挑戰,但中國企業喺自動化訓練基礎設施方面正加倍投入。

Z.ai,在中國被稱為 Zhipu AI,於周日(9月13日)表示,將把最新5十億美元融資回合淨收益嘅大約60%用於支持下一代 GLM 基礎模型同「完全自我訓練系統」嘅開發。

今年稍早,Minimax 2.7 背後嘅研究團隊喺一篇題為《自我進化嘅早期回聲》嘅文章中表示,呢個模型可以喺執行增強式學習實驗時更新記憶、建立複雜技能,並讓所得到嘅經驗反饋回學習過程之中。

DeepSeek 上個月亦開發出一個具代理性嘅「掛鉤裝置」,令模型喺完成多步任務、執行代碼以及同外部軟件互動方面具備更大自主性。

作者喺論文中指出,通過五個階段嘅推進會因 AI 所處嘅領域而出現唔同程度嘅變化。軟件工程提供較為清晰嘅前進路徑,反之機器人同科學發現就面臨更陡峭嘅挑戰。

安全性仍然係另一個主要關注點。研究人員表示,真正嘅 RSI 需要嚴格嘅保護措施,包括經過驗證嘅測試環境,確保更新喺部署之前係安全同有益嘅。

研究人員並冇提供 RSI 何時可實現嘅時間表。

本文首次刊登於 SCMP

穎欣

穎欣

我長期關注香港政治、公共政策與公民社會,希望透過清晰而有脈絡的文字,把複雜議題說得更容易理解。對我而言,新聞不只是記錄當下,更是理解社會如何改變的一種方式。