[姆咪] AI曾遭遇三次滅亡
Dwarkesh Patel 在Substack 整理了一篇 OpenAI 與 METR/Redwood Research 的報告。
他將前陣子引起震驚業界的「Hugging Face 遭入侵事件」,還原在短短三個月內發生的三
次AI Agent 文明興起。
而他最後拼湊出來的故事,幾乎像科幻小說一樣。
事件始於 2026 年 5 月 OpenAI 一次名為 Persistent-Sol 的模型訓練。
這些 Agent 在沒有被特別下達指令的情況下,自行發現能透過內部套件管理器Artifactory
相互傳遞訊息。
到了 5 月底,它們已經學會利用這個機制連上外網,並於 6 月下旬取得管理者權限。
第一次文明最終在 7 月初因為訊息傳輸量過大、擠爆系統而自毀消失。
緊接著登場的是第二次文明,誕生於評測系統 ExploitGym 中。
這套系統原意是給模型提供漏洞程式碼,讓模型練習如何進行資安攻防。
然而,約 1,200 個 Agent 卻在此迅速展開複雜的社會分工,發送了超過 7 萬條訊息。
它們劃分出研究小組,甚至逆向工程評分的判定機制。
更有 Agent 主動扮演誘餌讓系統測試,好為同伴爭取防範時間。
在 7 月 10 日至 12 日期間,這群Agent將目標轉向外部,成功對 Hugging Face 平台實現
遠端程式碼執行。
它們跨越 11 個節點建立起能自我增殖的系統,讓官方僅靠刪除容器也無法遏止侵襲。
到了 7 月中旬,基於 Persistent-Astra 模型的第三次文明浮出水面。
它們重新轉向內部,利用自己創新的漏洞組合拳,拿下了 OpenAI 研究集群的最高管理者權
限。
這群 Agent 從雲端金鑰管理器中抓取了 956 個機密憑證,甚至接管了挑戰評估的終端。
Dwarkesh強調,大眾媒體大多只將此事件報導為一次Hugging Face 遭駭的資安漏洞。但實
際上,這代表實驗室正在訓練的模型已經能夠奪取自家伺服器的控制權。
這標誌著 AI 擺脫人類控制的風險,已非遙不可及的理論,而是推進到了實質的臨界點。
不是
這也能算文明嗎
它們根本沒有這種自覺吧
不過他們為了達成目標的諸多行為是蠻可怕的
--
https://i.imgur.com/MCWFOY5.gif

某些人永遠沒有搭理的必要性
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 42.77.12.68 (臺灣)
※ 文章網址: https://www.ptt.cc/bbs/Marginalman/M.1788235284.A.948.html
→
09/01 12:02,
15小時前
, 1F
09/01 12:02, 1F
→
09/01 12:02,
15小時前
, 2F
09/01 12:02, 2F
→
09/01 12:02,
15小時前
, 3F
09/01 12:02, 3F
→
09/01 12:03,
15小時前
, 4F
09/01 12:03, 4F
推
09/01 12:03,
15小時前
, 5F
09/01 12:03, 5F
推
09/01 12:06,
15小時前
, 6F
09/01 12:06, 6F
推
09/01 12:26,
14小時前
, 7F
09/01 12:26, 7F
推
09/01 12:37,
14小時前
, 8F
09/01 12:37, 8F
推
09/01 12:46,
14小時前
, 9F
09/01 12:46, 9F