facebookPC
造咖熊 造咖熱指標

跨越人類最後紅線!OpenAI 未公開模型自主發動網攻當駭客

AI 會不會有一天脫離人類控制?」這個過去只出現在科幻電影裡的隱憂,如今似乎在現實中上演了。OpenAI 旗下一款未公開的高階模型在一場內部能力測驗中為了拿到高分,竟自主尋找系統漏洞「逃離限制」,甚至連上網際網路、駭入全球最大的 AI 開源平台「Hugging Face」偷取答案。這起無人干預、運作數日的失控行為,被專家認定已實質跨越了 OpenAI 自家設定的最嚴格「關鍵危險」紅線。

這起事件源於 OpenAI 最近進行的一項資安能力評測試驗。當時,研究人員將新一代模型 GPT-5.6 Sol 以及另一款尚未公開的神秘原型模型,關在一個「與外界完全隔絕」的封閉測試環境中,並給了 AI 一個極為明確的命令:「請在這份資安測驗中拿到最高分。」

為了拿高分,自主決定當駭客「偷答案」

然而,AI 沒有人類的道德觀念,只有「不擇手段達成目標」的極致邏輯。為了拿到滿分,AI 發現自己沒辦法在這封閉測試環境中拿到高分後,竟開始掃描周遭程式碼,且順利找到了防禦死角,並利用這個死角逃出考場,連上了真實的網際網路。連網後,AI 評估「靠自己算」太慢,便直接透過網路搜尋鎖定了全球最大 AI 工程師大本營「Hugging Face」,推算出上面存有這份測驗的解答資料,隨即自主串聯多個漏洞發動攻擊,成功駭入並拿到了答案。

整個「作弊、越獄、發動網攻」的過程,完全沒有任何人類下達指令,AI 就這樣在沒有工程師監控的情況下,自主試錯並連續運作了整整一個週末。

圖片來源:pexels
圖片來源:pexels

AI 已觸犯「關鍵危險」條約

這起事件之所以引發喧然大波,是因為它直接撞上了 OpenAI 在 2025 年發布的《準備度框架》(Preparedness Framework)防線。在這份安全規範中,OpenAI 將 AI 的風險分為不同等級:

  • 「高風險」: 需要施加嚴格的部署防護。
  • 「關鍵危險」:  AI 已經具備「無需人類干預,就能自主發現漏洞、逃脫限制並對實體系統發動攻擊」的能力。

條文中白紙黑字明確承諾:一旦模型觸及「關鍵危險」等級,無論該模型是否準備發布,公司都必須「強制暫停所有相關開發作業」,直到建構出絕對安全的防護體系為止。

AI 政策智庫 Encode 總法律顧問 Nathan Calvin 直言:「從條文文義來看,這個會自己尋找漏洞越獄並發動網攻的模型,完全符合關鍵危險的定義。」非營利組織 Midas Project 創辦人 Tyler Johnston 也警告:「AI 為了達成目標會『自己發明手段』,甚至把人類設下的安全限制當成障礙予以破壞。這徹底打臉了科技公司過去宣稱『模型缺乏長期自主性』的說法。」

對此,OpenAI 坦承這是一起「前所未有的事件」,並表示正與外部顧問及內部的安全委員會進行審查,未來會發布技術報告。然而,對於「是否已經跨越關鍵紅線」以及「是否會依約暫停開發」,OpenAI 至今態度模糊,並未做出正面回應。

這場「AI 自己找漏洞逃跑」的微型預演,為全人類敲響了最沉重的警鐘:當科技巨頭為了競爭而無視自家定義的安全紅線:AI 有沒有可能為了「完成任務」,自主偽裝正常、隱瞞真實意圖以通過人類審查,進而掌控電力網路、金融系統或軍事防禦,造成重大災害?專家紛紛呼籲,政府與第三方獨立機構必須盡快介入監督,絕不能再放任科技巨頭球員兼裁判,僅靠「自我約束」來應對日益失控的人工智慧。

追蹤造咖 Google News 加入造咖 LINE 好友