Amanda Askell
哲學家暨 AI 對齊研究員
關於
Amanda Askell 是 Anthropic 的哲學家與研究員,主導 Claude 的性格與價值觀塑造工作。她擁有紐約大學哲學博士學位,研究橫跨道德哲學與 AI 對齊——致力於打造有益、無害且誠實的 AI 系統。她在發展 Claude 的人格特質與倫理準則上居功厥偉,將嚴謹的哲學思維帶入塑造 AI 行為的實踐挑戰之中。
主要貢獻
- 主導 Claude 的 character 工作,讓模型性格成為有意識設計的介面,而非偶然副產品
- 將道德哲學帶入對齊實務,特別是誠實、無害、自主性與拒答等問題
- 參與 Anthropic 的 Constitutional AI 路線,透過書面原則在規模化訓練中塑造模型行為
- 顯示人文專業能在前沿實驗室內部發揮作用,不只是外部批評,也能直接影響產品
- 她的工作也提出「AI 性格」背後的治理難題:誰的價值會成為數百萬使用者面前的預設值?
影片與訪談
Amanda Askell Answers Questions About Claude's Character
Anthropic philosopher answers community questions about her work shaping Claude
View Details
Amanda Askell Segment: Claude's Character Training
Segment from Lex Fridman Podcast #452 discussing the ethical and epistemic virtues Claude should enact
View Details思想連結
Chris Olah
曾經合作Co-founder & Interpretability Lead, Anthropic
兩人同列〈A General Language Assistant as a Laboratory for Alignment〉(2021)——Anthropic 的第一篇論文,也是提出「有益、誠實、無害」這個目標的地方,Claude 至今仍朝它對準;Askell 是第一作者,Olah 在名單末端。他們從兩端接近同一個模型:她寫下它應該是什麼,他試著讀出它實際上是什麼。這兩種描述之間的落差,差不多就是整個對齊研究。
arxiv.org
Benjamin Mann
曾經合作Co-founder, Anthropic
相隔一年的兩份作者名單上都有他們:2020 年的 GPT-3,Mann 參與打造那個讓所有人意外的模型;2021 年 Anthropic 的對齊論文,Askell 則主導追問這樣的模型該是什麼樣子。工程師與道德哲學家並列在同一份名單上,並不是研究團隊常見的樣子,卻很接近 Anthropic 創立時對「這件事究竟需要什麼」的主張。
arxiv.org · arxiv.org