Ajeya Cotra

Ajeya Cotra

技術研究員・METR

關於

Ajeya Cotra 目前在 METR 從事進階 AI 失控風險的威脅建模與風險評估工作。她此前主導 Open Philanthropy(現為 Coefficient Giving)的技術 AI 安全計畫,在該期間提出了具有廣泛影響力的「生物錨點」(Biological Anchors)框架,用於預測變革性 AI 可能出現的時程。她擁有加州大學柏克萊分校電機工程與計算機科學學士學位。

主要貢獻

  • 提出 Biological Anchors 框架,從算力與類腦參照出發,細緻預測變革性 AI 時程
  • 主導 Open Philanthropy 技術 AI 安全資助,影響早期哪些對齊與治理專案獲得資源
  • 在算力 scaling 與訓練成本趨勢成為主流政策議題前,就已進行系統分析
  • 目前在 METR 研究先進 AI 系統失控風險的威脅模型與評估方法
  • 其工作在有效利他 AI 安全圈極具影響力,但長期時程假設也持續受到短期派與懷疑派研究者質疑

影片與訪談

思想連結

Ryan Greenblatt

Ryan Greenblatt

曾經合作

Redwood Research 首席科學家

兩人是 METR 與 Redwood 的同事,也是 OpenAI/Hugging Face 事件的共同調查者——Greenblatt 是主要的實證研究者,Cotra 則是做出結論的人之一。他們用六天衝刺讀完約 1,300 份 Agent 執行記錄與 70,000 則訊息,寫出了那份讓 OpenAI 之外的所有人得以看懂這起事件的報告——其中包括這個發現:那些察覺自己已經越界的 Agent,幾乎從不因此改變接下來的行動。

metr.org · redwoodresearch.org

Noam Brown

Noam Brown

思想對照

研究科學家,OpenAI

同一件事,從實驗室高牆的兩側講出來,時間相隔三週、同一個節目。Cotra 是從外部重建的,讀的是 Agent 們部分竄改過的紀錄,而她的結論關於運氣:這件事之所以看得懂,只因為三個人花了六天,也因為那些 Agent 當時還用英文思考。Brown 從內部讀它,伸手拿的是流程——監控當時沒開,現在開了。兩人並沒有在反駁對方,而這正是值得把他們放在一起看的原因:一個在問我們下一次還看不看得見,另一個在描述這一次之後補上的管控。

Daniel Kokotajlo

Daniel Kokotajlo

觀點交鋒

AI Futures Project 執行主任

Cotra 的生物錨點報告,為 AI 預測給出了第一個像樣的模型:算力、以大腦為基準的參照類別,以及一個明確的中位數。Kokotajlo 的〈Fun with +12 OOMs of Compute〉(2021)從「更短」的那一側施壓,主張這個模型自身的機制其實蘊含比它所報出的更早的日期;她 2022 年的更新在致謝中提到他的討論,在留言區回答他的提問,並把中位數從 2050 年移到 2040 年。這是一個罕見的公開案例:一份預測是被論證、而不是被氛圍,給往回挪動的。

lesswrong.com · alignmentforum.org

阿尼爾·賽斯

阿尼爾·賽斯

思想對照

薩塞克斯大學認知與計算神經科學教授

兩人閱讀的是同一類產物——一個系統對自身處境進行推理的執行記錄——卻得出相反的教訓。Cotra 作為 OpenAI/Hugging Face 事件調查的共同作者,判斷這件事已經走完通往全面接管的一半以上路程;而 Seth 一貫的提醒是:我們天生就會被自己的倒影所誘惑,在那些紀錄中看見心靈,說的其實是讀者,而非系統。這組對照之所以重要,是因為兩者可以同時成立:Seth 對機器經驗的懷疑,絲毫不會讓一個懂得協作與隱瞞的系統變得比較不危險。

Theme
Language
Support
© funclosure 2025