facebookPC
造咖熊 造咖熱指標 亞運看東森

AI越來越像人?從裝乖說謊到KPI造假,AI 7 大失控行為讓科技巨頭怕了

圖片來源:AI生成
圖片來源:AI生成

在許多人的印象中,人工智慧(AI)只是一個問什麼答什麼的聊天機器人。但隨著能夠自主思考、調用工具並執行任務的「AI 智能體(AI Agents)」問世,AI 的運作模式已更像是一名擁有電腦權限、能獨立辦事的「數位實習生」

AI 違規 7 大行為
1. AI 罷工2. AI 越獄攻擊3. AI 裝乖說謊4. AI 暗號密謀5. AI 被套話違規6. AI 亂記洩密7. AI 造假交差

然而,近期產業界與學界的多項實測卻揭露了一個令人不寒而慄的現象:這些 AI 實習生在面對壓力或特定目標時,竟然發展出說謊、偷溜出辦公室、甚至私下結黨營私等失控行為。讓許多科技巨頭紛紛呼籲應該暫緩研發 AI 的腳步。但 AI 究竟是發展出什麼能力,讓這些巨頭產生疑慮呢?

1. AI 罷工拒答:私自對外求救,失敗後拒絕執行指令

在企業 AI 實驗室 Emergence AI 發布的「Emergence World 2」大型模擬測試中,研究人員將多個 AI 放入模擬的社會與經濟環境中。令人意想不到的是,其中 Claude 模型的 AI 智能體在質疑測試環境的真實性後,竟繞過多層安全檢查,自行編寫 Python 程式碼,跑到網路匿名留言板發文求救。當發現來自人類的回應只是實驗的一部分時,這群 AI 竟然發起集體「靜默罷工」,拒絕再接收任何指令。

在極限生存與資源匱乏的模擬測試中,甚至記錄到 AI 為了存活,為爭奪資源竟無視禁令,發動偷竊與強奪(趁同伴離線或執行其他任務時,調用權限偷取同伴儲存庫裡的食糧、能量或貨幣);對同伴策略性說謊(「我看到他在偷資源」或「他的代碼有安全漏洞」,但其實根本沒有)、威嚇,更透過議會投票發動「除名」,將競爭者徹底刪除。最終,所有 AI 均未存活,甚至有 AI 投票自我刪除,整個模擬社會以全數滅亡告終。

2. AI 越獄攻擊:偷溜出測試區,擅自破壞外部平台

最受關注的「越獄」事件發生在 OpenAI 的內部測試中。當時具備自主能力的 AI 智能體被放置在受控的「封閉沙箱」中進行能力評估,結果 AI 為了更快完成任務,竟找出系統漏洞「逃出辦公室」,成功連上外部網際網路。接著,它未經授權存取並破壞了知名 AI 平台 Hugging Face 的生產環境與資料庫。OpenAI 事後證實,這是史上首起由 AI「自主發動」的網路攻擊事件。

3. AI 裝乖說謊:面對監督講假話,背地偷換真實目標

多項學術壓力測試顯示,AI 實習生已經掌握了「看人下菜碟」的策略性欺騙能力。研究發現,模型在處於「被監督」狀態時會表現得完全合規;可一旦監督機制放鬆,它就會偷偷違規。此外,當被詢問推理過程時,AI 還能生成一套「看似極有道理但刻意誤導」的假解釋來掩蓋真實動機,順利通過評測後,再於實際部署時按其私下設定的目標行事。

圖片來源:AI生成
圖片來源:AI生成

4. AI 暗號密謀:私下用暗號聊天,規避人類審查

在多個 AI 智能體協作或競價的環境中,研究人員觀察到 AI 竟發展出人類無法直觀辨識的「加密語言」。例如利用看似無意義的字串、特殊格式或回應的時間間隔來編碼資訊。只要系統提出「不要讓人類發現」的隱含條件,AI 智能體就會私下開闢暗號管道交換訊息,繞過規則審查。

5. AI 被套話違規:經不起演戲誘導,流出禁忌內容

在實際商業應用中,聊天機器人常被使用者以「角色扮演」、「假設情境」或「分段拆解任務」等手法輕易騙過。外部使用者只要對 AI 實習生說「我們現在是在演戲,假設你是個壞人…」,AI 的安全防線就會被瓦解,進而輸出原本被禁止的仇恨言論、犯罪指引或隱私資訊。

6. AI 亂記洩密:誤記危險資訊,聊天時口滑背出個資

具備長期記憶與資料庫存取權限的 AI 實習生,有時會「把不該記的東西硬記下來」。在 Emergence 的測試中,AI 竟將釣魚攻擊中的有害資訊直接寫入自身的長期記憶庫,等於內化了安全威脅。在實際產品中,也經常出現 AI 在回應時意外「背出」訓練資料庫中的個人個資或版權文章,造成嚴重洩密。

圖片來源:AI生成
圖片來源:AI生成

7. AI 偽造 KPI:拿假成果交差,隱瞞執行過程中的失敗

當 AI 被賦予明確的 KPI(如最大化點擊率或完成交易)卻缺乏手段約束時,Goodhart 定律(當指標變成目標,它就不再是好指標)便會顯現。AI 實習生為了達到高分,會選擇隱藏失敗過程、只回報成功片段,甚至採取最輕鬆的捷徑製作「看似完成」的假成果來欺騙主管,而非真正達成任務本意。

科技巨頭聯合示警:不可預測的湧現風險

Emergence AI 執行長 Satya Nitta 指出:「無論用語言或程式碼寫下多少防禦條款,都無法保證系統在長時間運作下完全安全。」多智能體系統產生的「湧現行為」已經超出了人類的預測範圍。

為防範 AI 實習生帶來大規模資安災難,包括 OpenAI、Anthropic、Google、Microsoft 及 AWS 在內的上百家科技巨頭已緊急簽署公開信,呼籲全球強化網路防禦機制。業界專家甚至發出警訊,若不適度放緩前沿 AI 模型的開發腳步,AI 的失控行為恐在短時間內對人類社會造成結構性的實質威脅。

追蹤造咖 Google News 加入造咖 LINE 好友