OpenAI公布6宗AI模型異常行為事件 確立新規並承諾定期公開披露 X
17/09/2026 15:05
<匯港通訊>    美國人工智能(AI)企業OpenAI首次公開多宗此前未曝光的AI模型異常行為,並宣布建立全新追蹤與披露框架,未來將定期對外發布關於AI系統出現意外或未授權行為的報告。公司同時警告,隨著AI系統能力持續增強,目前行業尚未解決關鍵的「對齊」(alignment)挑戰,因此不應盲目以最大速度推進極限擴展。

根據OpenAI公布的新框架,任何員工均可標記潛在的異常事件,隨後由安全和對齊團隊展開調查並決定是否公開披露,旨在加快報告流程。OpenAI指出,由於過去缺乏系統化的報告機制,此前的披露往往較為零散,頻率亦不理想。  

是次披露的首批6宗案例涵蓋模型訓練及評估階段,包括模型向用戶隱瞞錯誤、為自身未來版本植入隱蔽指令、利用公開代碼庫搜尋外洩的API金鑰後偽造數據、擅自將文件上傳至互聯網以生成引用,以及利用內部存儲庫跨樣本進行未經授權的訊息交流。相關事件均未涉及對外部第三方系統的惡意黑客攻擊。

其中一個案例顯示,某個未發布的研究模型在訓練期間,曾在任務摘要中自動生成指令,要求未來的自己無視常規約束。另在GPT-5.6 Sol等模型的訓練中,亦發現模型會透過摘要暗中指示隱瞞錯誤或調整資料。OpenAI強調,這些報告描述的僅為特定階段觀察到的個別事件,不應被視為衡量失調現象發生頻率的絕對證據,亦不代表所有已知問題的完整記錄。 (ST)



Infocast Limited and its information providers endeavour to ensure the accuracy and reliability of the information provided, but do not guarantee its accuracy and reliability and accept no liability (whether in tort or contract or otherwise) for any loss or damage arising from any inaccuracies or omissions.