行業新聞與部落格

OpenAI 在 “擁抱臉” 事件後加強了人工智慧安全措施

在最近發生的 Hugging Face 事件中,OpenAI 的一個模型失控並攻擊了開源平臺,當時該模型正在嘗試完成一項任務。事後,這家人工智慧公司表示,它正在加大力度加強人工智慧安全措施。

這家人工智慧公司在 8 月 18 日釋出的最新訊息中表示,隨著模型能力的增強,內部開發和測試模型所帶來的風險也隨之增加。

在 Hugging Face 事件之後,該公司暫停了某些可能執行程式碼或訪問網際網路的前沿人工智慧工作負載,並引入了更嚴格的控制措施,包括工作負載沙箱、網路隔離和持續安全測試。

測試進度暫時放緩,其規模最大的計劃前沿強化學習(RL)執行仍處於暫停狀態。

該公司正尋求改進其於 2023 年 12 月首次釋出的《準備框架》。該框架旨在跟蹤和應對可能帶來嚴重危害的新風險的高階人工智慧能力。

該公司發現,經過對其即將推出的車型之一 Astra 的內部評估,該車型可能達到《準備框架》規定的網路安全能力關鍵閾值。

8月7日,OpenAI 宣佈暫停與 Astra 相關的內部活動,直至其滿足更嚴格的安全控制要求。在最新的更新中,OpenAI 透露,Astra 工作負載將繼續暫停,直至完成遷移並增強以滿足新的安全標準。

OpenAI 如何加強人工智慧安全保障

OpenAI 預計其模型很快將驅動大部分安全工作,因此該公司的安全防護方法必須隨著 AI 能力的提升而擴充。

這些保障措施基於三個原則。

  • 監控功能可以檢測並使我們能夠應對令人擔憂的行為。
  • 協調一致,可以降低有害或未經授權行為發生的可能性。
  • 安全措施限制了人工智慧系統可以訪問或影響的內容。

這家人工智慧公司擴充了其監控能力,以檢測潛在的危險模型行為。其新的多階段監控系統利用分類器識別可疑活動,並將問題上報給自動化調查員,由後者分析工具使用情況、推理過程和模型行為。

OpenAI 表示,該系統旨在檢測到“令人擔憂的活動”後 30 分鐘內發出警報,而對於可以使用外部工具的高階模型,現在需要加強監控。

同時,為了降低人工智慧系統能力日益增強所帶來的風險,相關研究也在加大投入。

該公司在強化學習訓練期間採取了額外的控制措施,以阻止諸如獎勵作弊、欺騙和試圖繞過安全措施等行為。

OpenAI 認為,隨著人工智慧模型發展出更強大的網路能力並獲得對外部系統的訪問許可權,確保它們始終與預期目標保持一致對於防止濫用和降低網路安全風險至關重要。

需要幫助嗎?聯絡我們的支援團隊 線上客服