Diogo Almeida

Diogo Almeida

創辦人暨執行長,TypeSafe AI

關於

Diogo Almeida 是 TypeSafe AI 的創辦人暨執行長,也是 InstructGPT(2022)的第四作者——那篇 OpenAI 論文讓 RLHF 成為把語言模型變成助理的標準做法。他做過 ChatGPT 與 GPT-4 背後的 post-training,更早之前在 Google Brain。如今他主張,自己參與打造的這項技術,正是自動化卡住的原因。RLHF 最佳化的是人類偏好,而 reward model 要偵測「看得出來的不確定」,遠比查核答案是否正確容易得多——於是這個目標函數獎勵的是聽起來很有把握。照他的說法,hallucination 不是等著被修掉的瑕疵,而是目標函數照規格運作的結果;ChatGPT 之後的助理時代,則是偏離「能真正做事的軟體」的一段「weird detour」。TypeSafe 的答案是 RLCD——為校準決策而做的強化學習——以及一個叫 Jev 的模型:它回傳的是附帶機率的型別化數值,而不是散文。

主要貢獻

  • InstructGPT(2022)二十位作者中的第四位,那篇論文讓 RLHF 成為把語言模型變成助理的標準做法
  • 在 OpenAI 參與 ChatGPT 與 GPT-4 背後的 post-training,更早之前在 Google Brain
  • 主張 RLHF 的偏好目標讓 hallucination 成為內建而非意外:reward model 偵測「看得出來的不確定」,遠比查核正確性容易,於是訓練獎勵的是有把握的語氣
  • 依各自最佳化的目標把 post-training 分成三支——RLHF 對準人類偏好,RLVR 對準純粹的正確性,而 TypeSafe 的 RLCD 對準校準過的決策
  • 把 ChatGPT 之後的助理時代稱為偏離真正自動化的「weird detour」,並指出 SaaS 自 2019 年以來幾乎沒變,只是旁邊多掛了一個聊天機器人
  • 創辦 TypeSafe AI 並在 2026 年 9 月推出 Jev:回傳的是符合事先定義好的 schema 的數值,並附上這間實驗室所謂校準過的機率,而不是自由文字

時刻時間軸 查看所有時刻

2026 年 9 月

Jev 與 System One Models

在隱形了兩年之後,TypeSafe AI 發表 Jev,同時也為它宣稱開出的這個類別取了名字:System One Models。它主打的是合約的改變,而不是底層的改變。語言模型拿到 prompt,一次吐一個 token 的自由文字;Jev 則是拿到輸入與一份 schema,回傳符合該型別的數值,並附上校準過的機率——照這間實驗室的說法,是在一次查詢裡完成的。創辦人 Diogo Almeida——InstructGPT 二十位作者中的第四位,也就是讓 RLHF 成為標準的那篇論文——把它定位成 post-training 的第三支,並依各自最佳化的目標把這個領域分開:RLHF 對準人類偏好,RLVR 對準純粹的正確性,而 TypeSafe 的 RLCD 對準校準過的決策。他的論點是,偏好最佳化讓 hallucination 成為內建的:reward model 要偵測「看得出來的不確定」,遠比查核正確性容易得多,於是訓練獎勵的是有把握的語氣。底下的智慧仍然來自 pre-training:Almeida 說 pre-training「phenomenal」,問題在於「how we unearth it」,並把這套方法描述成把預訓練模型的智慧直接導進對軟體真正有用的形式。至於底座是誰的模型、TypeSafe 是否自己做了預訓練,都沒有揭露,參數量與 context window 也一樣。Jev 自己的數字確實是 TypeSafe 的,由 TypeSafe 在同一天才釋出的早期存取模型上量出來的:70 到 500 毫秒的回應,以及每百萬輸入 token 0.042 美元、輸出免費。但拿來對照的那個 3 到 329 秒的前沿模型區間並不是他們量的——那是從第三方的 benchmark 網站引來的。而 0% hallucination 根本不是量出來的:這間實驗室自己說得很白,這個數字「不是實證的」,是因為 schema 匹配有保證,他們才敢在圖上放一個零。它描述的是對 schema 的合規,不是真實性。早期存取已經開放,但目前還沒有任何獨立發表的數字。

影片與訪談

論文與出版物

Theme
Language
Support
© funclosure 2025