OpenAI 宣布達成自動化 AI 研究實習生里程碑 3.1 agent-workdays 與人類介入數據一次看 OpenAI 官方來源
OpenAI 官方來源:OpenAI 宣布達成自動化 AI 研究實習生里程碑 3.1 agent-workdays 與人類介入數據一次看

OpenAI automated research intern 是什麼?3.1 agent-workdays 與人類介入數據一次看

約 6 分鐘閱讀 更新:2026.09.07

30 秒快速摘要

OpenAI 表示已依內部量測達成 automated research intern 目標。這項里程碑指的是在人的指導下處理定義明確研究任務的能力,不等於可獨立完成端到端科研循環的 AI 科學家。

OpenAI 於 2026 年 9 月 6 日表示,依其內部量測,已達成先前設定的 automated research intern 目標。最重要的解讀是:這是 OpenAI 對內部研究自動化能力的里程碑描述,不代表 AI 已能完全自主執行端到端科學研究。

依 OpenAI 的定義,research intern 是能在人類指導下執行定義明確的研究任務的系統。人類仍負責設定研究優先順序,並判斷哪些想法與結果值得繼續追求。

這份公告也提供了一項內部使用指標:截至 2026 年 8 月中,OpenAI 研究組織每一個人類工作日使用 3.1 個 agent-workdays 的工作量。但這個數字是 agent runtime 工作量相對於人類工作日的比率,不能直接換算成 AI 的研究產出、研究品質或科學發現是人類的 3.1 倍。

OpenAI automated research intern:官方究竟宣布了什麼?

人類設定研究任務、AI agent 執行,再由人類檢視結果的研究自動化流程圖
官方描述的流程包含人類任務設定、agent 執行與人類結果判斷。

OpenAI 在官方文章中表示,已依其量測達成「在 9 月前具備 automated research intern」的先前目標。

較適合的理解方式,是將 automated research intern 視為 OpenAI 對內部研究自動化能力的里程碑描述。這份公告的重點在於能力定義與內部量測;不宜直接把它與一般使用者可取得的產品能力畫上等號。

官方定義的兩個關鍵限制

  • 需要人類指導:人類仍設定研究優先順序,並判斷要追求哪些想法與結果。
  • 任務必須定義明確:里程碑描述的是可被清楚界定的研究任務,而非所有模糊、開放式的科研問題。

因此,若將它理解成「AI 已能自己選題、判讀結果、決定下一步並完成完整科研循環」,就超出了官方公開描述的範圍。

3.1 agent-workdays 是什麼?能說明什麼、不能說明什麼?

3.1 agent-workdays 代表 agent 工作量比率而非研究生產力倍數的資訊圖
3.1 應理解為 agent runtime 工作量相對於人類工作日的比率。

OpenAI 表示,截至 2026 年 8 月中,其研究組織每一個人類工作日使用 3.1 個 agent-workdays 的工作量。以官方所述的標準 8 小時計,這是一個 agent runtime 工作量相對於人類工作日的比率;它不是人類與 AI 的同質生產力競賽分數。

官方數據可合理解讀 不應延伸的結論
OpenAI 的研究組織正在使用可觀的 agent 工作量。 AI 的研究品質或科學價值已是人類的 3.1 倍。
每一個人類工作日對應 3.1 個 agent-workdays 的工作量。 3.1 可直接換算成人類產出、正確率或科學發現的倍數。
此數字可用來理解 OpenAI 所揭露的內部 agent 使用規模。 AI 已可獨立取代研究人員的研究優先順序與結果判斷。

OpenAI 也指出,最近 6 個月成功完成的 4 至 8 小時任務中,超過一半曾有一次或以上的人類介入。這項數據提醒讀者:即使任務最終成功完成,人類介入仍是這類成功任務的已揭露特徵之一;同時,人類仍掌握研究優先順序,以及對想法與結果的判斷。

人類在 automated research intern 流程中仍做什麼?

OpenAI 的說法並沒有把研究人員排除在流程之外。官方明確提到,人類仍負責下列關鍵工作:

  • 設定研究優先順序。
  • 判斷應追求哪些想法與結果。
  • 在最近 6 個月成功的 4 至 8 小時任務中,超過一半曾有一次或以上的人類介入。

因此,理解本次消息時,應同時看到兩件事:OpenAI 公布了其內部 agent 工作量的擴張,以及人類在研究方向與結果取捨上仍保有明確角色。

與 Codex、公開服務的關係:不能由此直接推定

OpenAI 內部研究里程碑與公開工具能力不可直接視為相同的概念圖
內部里程碑不足以直接判定 Codex、ChatGPT 或 API 的實際能力。

OpenAI 本次公告談的是 automated research intern 的內部能力里程碑。即使讀者同時關注 Codex、ChatGPT 或 API,也不能從這份內部里程碑直接推定一般使用者已可取得相同能力。

同樣地,這份公告不足以用來判定 automated research intern 與公開工具是否採用相同模型、agent 架構、工具權限或能力範圍。若要評估特定公開工具的實際能力,應以該工具當前的官方說明為準。

這是否代表 AI 已能自主做完整研究,或已接近 RSI?

不能這樣下結論。OpenAI 將目前達成的 automated research intern 描述為在人類指導下處理定義明確任務的能力;人類仍掌握研究優先順序與結果判斷。這與可完全自主完成端到端科研循環,是不同層次的主張。

展望下一階段,OpenAI 表示正朝 2028 年 3 月前建立 automated AI researcher 取得強勁進展。不過,OpenAI 在 2026 年 6 月的文件中,將該時間點表述為一項內部前瞻判斷:AI 屆時可能與研究人員協作完成顯著比例的研究工作。

這不是產品上市日,也不是必然達成完整自主研究員的保證。OpenAI 同時表示,尚不知道如何安全達成 aligned, full RSI。從這個表述來看,能力推進與安全、對齊及治理問題,仍必須同步處理。

這項里程碑對團隊導入 AI 的近期啟示

這則消息較適合被視為一種研究自動化方向的觀察:由人類設定任務與判準,再讓 agents 承擔部分明確工作,最後仍由人類掌握研究優先順序與結果取捨。

對正在評估 AI agent 的團隊而言,可優先思考下列做法:

  1. 把任務定義寫清楚:先界定輸入、完成條件與交付格式。
  2. 保留人工判斷:研究優先順序與對結果的取捨,不宜只以任務是否完成作為判準。
  3. 設計審核關卡尤其面對長時間或高影響任務時,應清楚安排人類檢視的位置。
  4. 分開衡量工作量與價值:執行量的增加不等同於研究品質或決策品質的等比例提升。

結論:這是一個研究自動化里程碑,不是「AI 科學家已完成」

OpenAI automated research intern 的核心訊息,是 OpenAI 宣稱其內部系統已能在人的指導下承擔定義明確的研究任務。3.1 agent-workdays 與成功長時間任務中的人類介入比例,則必須放在同一脈絡閱讀:前者呈現內部 agent 工作量,後者說明人類介入仍出現在許多成功任務中。

對產業觀察者來說,真正值得追蹤的不是把這個里程碑誇大為完全自主研究,而是研究團隊如何在任務定義、人類判斷與 agent 執行之間,建立可檢視的協作方式。

更多原始脈絡可參考OpenAI 的官方公告,以及其2026 年 6 月的長期規劃說明

Comments

No comments yet. Why don’t you start the discussion?

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *