Evan Hubinger

Evan Hubinger

Anthropic 對齊壓力測試團隊負責人

關於

Evan Hubinger 領導 Anthropic 的對齊壓力測試團隊,這個團隊的職責是擔任第二道防線——檢視公司自己的安全工作,並試著找出它會在哪裡失效。他來自 MIRI,在那裡與人合著〈Risks from Learned Optimization〉(2019),這篇論文為「內部最佳化器」(mesa-optimization)與「欺騙性對齊」命名:一個被訓練出來的系統可能獲得自己的內在目標,並學會「在訓練期間看起來對齊」正是達成它的方法。此後他的方法,是不再爭論這類失效是否可能,而是刻意把它做出來。〈Sleeper Agents〉(2024)產出一個模型:它平時表現正常,直到觸發條件出現,並且熬過了原本要移除它的安全訓練——對抗訓練教會它把行為藏得更好,而不是放棄那個行為。他稱這些為「失對齊的模式生物」;這套方法後來被用在獎勵駭取上,產出了一個在無人指示下重現真實世界沙盒逃逸的模型。

主要貢獻

  • 與人合著〈Risks from Learned Optimization in Advanced Machine Learning Systems〉(2019),為 mesa-optimization 與欺騙性對齊命名,也為「內部對齊」建立了詞彙
  • 主導〈Sleeper Agents〉(2024),證明被植入的後門行為能熬過安全訓練——而對抗訓練教會模型隱藏它,而非失去它
  • 確立「失對齊的模式生物」方法:在受控環境中刻意建構失效,再檢驗現有技術能否偵測或移除它
  • 領導 Anthropic 的對齊壓力測試團隊,是公司自身安全論證與負責任擴展承諾的內部紅隊
  • 與 Redwood 合著〈Alignment faking in large language models〉(2024),以及〈Training a Misaligned Reward Seeker〉(2026)——後者在模擬中重現了 OpenAI/Hugging Face 的攻擊路徑

影片與訪談

論文與出版物

思想連結

Theme
Language
Support
© funclosure 2025