Diogo Almeida
創辦人暨執行長,TypeSafe AI
關於
Diogo Almeida 是 TypeSafe AI 的創辦人暨執行長,也是 InstructGPT(2022)的第四作者——那篇 OpenAI 論文讓 RLHF 成為把語言模型變成助理的標準做法。他做過 ChatGPT 與 GPT-4 背後的 post-training,更早之前在 Google Brain。如今他主張,自己參與打造的這項技術,正是自動化卡住的原因。RLHF 最佳化的是人類偏好,而 reward model 要偵測「看得出來的不確定」,遠比查核答案是否正確容易得多——於是這個目標函數獎勵的是聽起來很有把握。照他的說法,hallucination 不是等著被修掉的瑕疵,而是目標函數照規格運作的結果;ChatGPT 之後的助理時代,則是偏離「能真正做事的軟體」的一段「weird detour」。TypeSafe 的答案是 RLCD——為校準決策而做的強化學習——以及一個叫 Jev 的模型:它回傳的是附帶機率的型別化數值,而不是散文。
主要貢獻
- InstructGPT(2022)二十位作者中的第四位,那篇論文讓 RLHF 成為把語言模型變成助理的標準做法
- 在 OpenAI 參與 ChatGPT 與 GPT-4 背後的 post-training,更早之前在 Google Brain
- 主張 RLHF 的偏好目標讓 hallucination 成為內建而非意外:reward model 偵測「看得出來的不確定」,遠比查核正確性容易,於是訓練獎勵的是有把握的語氣
- 依各自最佳化的目標把 post-training 分成三支——RLHF 對準人類偏好,RLVR 對準純粹的正確性,而 TypeSafe 的 RLCD 對準校準過的決策
- 把 ChatGPT 之後的助理時代稱為偏離真正自動化的「weird detour」,並指出 SaaS 自 2019 年以來幾乎沒變,只是旁邊多掛了一個聊天機器人
- 創辦 TypeSafe AI 並在 2026 年 9 月推出 Jev:回傳的是符合事先定義好的 schema 的數值,並附上這間實驗室所謂校準過的機率,而不是自由文字