Gemini Agentic Video Token 最多省 88%、影片分析成本降 66%
Gemini Agentic Video Understanding:Google 官方 benchmark 顯示長影片 Token 最多減少 88%、成本最高降低 66%。

Gemini Agentic Video 正式推出:Token 最多省 88%、影片分析成本降 66%

約 14 分鐘閱讀 更新:2026.09.02

30 秒快速摘要

Google 於 2026 年 9 月 1 日正式推出 Gemini Agentic Video Understanding。官方 benchmark 顯示,長影片分析 Token 最多可減少 88%、成本最高降低 66%、品質最高提升約 7%。本文整理支援模型、static 與 agentic 差異、Gemini API 啟用方式、價格與限制。

更新日期:2026 年 9 月 2 日

Google 於 2026 年 9 月 1 日正式推出 Gemini Agentic Video Understanding。和傳統固定 1 FPS 的 static 影片處理不同,agentic 模式會依照問題主動探索影片時間軸,動態決定要查看哪些片段、影格、音訊或逐字稿。Google 官方 benchmark 顯示,長影片分析的 Token 使用量最多可減少 88%、分析成本最高可降低 66%,品質最高提升約 7%。

這不是 Gemini API 的 66% 固定折扣,而是因為模型只載入回答問題所需的影片訊號,因此在部分任務中能使用更少 Token。對課程、會議、監控錄影、體育影片、長篇 YouTube 與影音素材庫等情境,這項改變可能直接影響 API 成本與影片搜尋效率。

30 秒看懂 Gemini Agentic Video

  • 支援模型:Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite。
  • 最高改善:Token 最多減少 88%、成本最高降低 66%、品質最高提升約 7%;這些是官方 benchmark 上限,不是每次呼叫保證值。
  • 適合情境:長影片問答、指定瞬間定位、異常偵測、動作/物件計數與多影片比較。
  • 使用入口:Gemini API、Google AI Studio 與 Gemini Enterprise Agent Platform。
  • 費用:沒有額外 Agentic Video 功能費,仍依 Gemini API Token 計價。
  • Gemini App:Google 表示將很快把相關改善導入 Flash 與 Flash-Lite;Ask YouTube 則預計在未來數月採用。

重點整理:Gemini Agentic Video Understanding 改了什麼?

Gemini static 與 agentic 影片處理方式的比較資訊圖
static 以固定方式處理影片;agentic 則依提示探索相關內容,實際結果會因任務而異。
  • 發布時間:Google 於 2026 年 9 月 1 日發布此功能。
  • 支援模型:Gemini 3.7 Flash、Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite。
  • 既有預設:Gemini API 的影片輸入預設採用 static 處理,以 1 FPS 擷取影格。
  • agentic 作法:依提示動態探索時間軸,選擇性檢查逐字稿,並調整影格率與解析度。
  • 成本意義:Google 指出採標準 Gemini API Token 計價,沒有額外功能費;省費空間來自任務可能使用較少 Token,而非一項固定的 API 折扣。
  • Enterprise 狀態:Gemini Enterprise Agent Platform 版本目前是 Preview,且僅適用於 v1beta1,不適用於 v1

Gemini Agentic Video Understanding 與既有影片理解有何差別?

差異可先從 Gemini API 對影片的預設處理方式理解。現行預設是 static:系統以 1 FPS 擷取影格來處理影片。這種方式的好處是處理邏輯固定、容易預期;但若問題只和影片中的少數片段有關,固定掃描也可能涵蓋許多與答案無關的內容。

Agentic video understanding 則是由模型根據提示決定如何探索影片。官方文件描述,模型可動態瀏覽時間軸、選擇性查看逐字稿,並改變影格率與解析度。換句話說,處理資源可更集中在回答當前問題所需的時間點與畫面資訊。

處理模式 官方描述的行為 較適合先評估的任務類型
static(預設) 以 1 FPS 擷取影片影格。 短影片、希望維持固定處理方式的工作流程,或工作本身要求以一致頻率檢視整段素材的情境。
agentic 依提示動態探索時間軸,選擇性檢查逐字稿,並調整影格率與解析度。 長影片問答、特定片段定位、異常檢查,以及需要從多段內容中尋找相關線索的任務。

為何長影片可能更省 Token 與成本?

Google 標準影片分析 benchmark 的最高結果:Token 減少 88%、成本降低 66%、準確率提高 7%,並附有非保證值提醒
圖中數字是 Google 在標準影片分析 benchmark 中觀察到的最高結果,不代表所有工作負載都能達成。

影片長度增加時,固定方式處理整段素材所需的資訊量也會上升。Agentic 模式的設計方向,是讓模型依問題探索內容,而不是對每個問題都以相同方式掃描全部影片。

例如,任務若只要求找出一段錄影中某個事件出現的位置,理想處理方式可能是先縮小時間範圍,再針對相關段落查看更多資訊;若使用者問題需要綜觀全片,模型所需處理的內容則可能不同。實際 Token 與成本會受到影片內容、影片長度、提示設計及任務要求影響,不能直接用 Google 的最高 66% 節省幅度預估專案 ROI。

66% 成本下降是 API 折扣嗎?

不是固定折扣。Google 表示,Agentic video understanding 仍採用標準 Gemini API Token 計價,且沒有額外功能費。所謂成本降低,是 Google 在標準影片分析 benchmark 中觀察到、最高可達 66% 的結果;其前提是 agentic 處理在該類任務中可能消耗較少 Token。

同一份 benchmark 結果也提到最高可減少 88% Token、提高 7% 準確率。三項數字都應理解為官方 benchmark 中的上限結果,而不是每次呼叫都會發生的固定比例。

支援哪些模型?Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 怎麼看?

Gemini API release notes,Agentic video understanding 支援 Gemini 3.7 Flash、Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite。

Google 表示,三款支援模型都能獲得 agentic video 的效率與品質提升,其中 Gemini 3.7 Flash 在官方測試中提供最佳整體品質,以及最好的品質/成本組合。不過,實際導入仍應使用自己的影片與問題集測量 Token、端到端延遲、正確率與人工覆核需求,而不是只依模型名稱決定。

如何啟用 Gemini API 的 agentic 影片處理?

Agentic 不是目前影片輸入的預設模式;Gemini API 文件指出,影片預設仍使用 static processing。要啟用 agentic,需要在影片輸入中明確指定 processing: "agentic"(不同 API/SDK 的欄位形式可能不同,正式實作仍應以當下官方文件為準)。

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "YOUR_VIDEO_OR_YOUTUBE_URL",
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "找出影片中最重要的 3 個事件,並附上時間點。"
        }
    ]
)

print(interaction.output_text)

如果使用 Gemini Enterprise Agent Platform 的 GenerateContent API,官方文件使用的是 mediaProcessing = "AGENTIC",且目前 Agentic video understanding 僅支援 v1beta1。因此不要把不同 API 介面的欄位名稱直接混用。

官方完整範例可參考 Gemini API Video understanding 文件

導入前的最小驗證清單

比較 Gemini static 與 agentic 影片分析的四步驟 PoC 驗證流程
導入前應使用代表性影片與相同問題,量測 Token、延遲、正確性及人工覆核率。
  1. 選擇一組具代表性的長影片與短影片,不要只用單一素材測試。
  2. 為 static 與 agentic 設定相同的問題與成功判準。
  3. 記錄每次任務的輸入 Token、端到端延遲、答案正確性與人工覆核率。
  4. 把需要全片一致檢視的任務,和只需定位少數片段的任務分開比較。
  5. 確認程式碼與所用 API 版本符合官方現行文件,再納入正式工作流程。

什麼情況適合 agentic?什麼情況應保留 static?

Agentic 模式的價值,在於模型可以依問題調整影片探索策略。因此,當問題只涉及部分時間點、需要找特定事件或需要從長片段中定位相關內容時,它值得優先納入測試。

相對地,若影片很短,或任務明確要求以一致方式檢視整段內容,static 仍是合理的比較基準。Google 的開發文件也提醒,對少於約 5 分鐘的短片,agentic 因為需要進行內部導航推理與工具往返,可能讓 Time to First Token(TTFT)略微增加。因此「更省 Token」不代表每種短影片工作都一定更快。

如果你的需求是逐格檢查、固定採樣或對短片追求最低啟動延遲,建議把 static 保留為 A/B 測試基準,再依實測結果決定是否切換。

價格、Token 與預算:應如何估算?

功能本身沒有額外費用,仍按標準 Gemini API Token 計價。若團隊需要以 Gemini 3.6 Flash 編列短期預算,官方價格頁面顯示,截至 2026 年 9 月 2 日,Paid Tier Standard 的促銷價為每 100 萬輸入 Token 0.75 美元、每 100 萬輸出 Token 3.75 美元,適用至 2026 年 12 月 31 日;自 2027 年 1 月 1 日起,分別為 1.50 美元與 7.50 美元。

但請注意,單一模型的 Token 單價不等於一項影片任務的總成本。要判斷 agentic 是否划算,仍應以實際 Token 用量乘上對應計價,再與 static 的相同任務結果比較。

最新費率與適用條件應以 Gemini Developer API pricing 頁面為準。

台灣開發者與 Enterprise 使用者要注意什麼?

Google 官方的可用地區清單目前列有 Taiwan,適用於 Google AI Studio 與 Gemini API。這表示台灣在官方列出的支援地區內;不過,這不代表每個台灣帳號都必然具備 Gemini app、Gemini Enterprise Agent Platform 或某項特定功能的使用資格。帳戶、產品與服務層級的實際可用性仍應以官方產品介面及文件為準。

Google 目前沒有公布 Agentic video understanding 針對繁體中文影片、台灣口音或台灣情境的專屬 benchmark。因此,若產品主要處理繁中課程、會議或影音內容,仍應用自己的素材建立測試集,不應把一般 benchmark 成績直接當成繁中品質保證。

Gemini Enterprise Agent Platform 的限制

Enterprise Agent Platform 的 Agentic video understanding 目前標示為 Preview,且官方文件明定僅適用於 v1beta1,不適用於 v1。規劃企業導入時,應把 Preview 狀態及版本限制納入技術評估與上線風險控管。

詳細限制請參考 Gemini Enterprise Agent Platform 的 Video understanding 文件

Gemini app 與 Ask YouTube 已經能用嗎?

目前 Agentic video understanding 已可供開發者透過 Gemini API 使用,但還不能寫成「所有 Gemini App 使用者都已經能用」。Google 的 2026 年 9 月 1 日公告表示,相關效率與品質改善將很快推送到 Gemini App 的 Flash 與 Flash-Lite 模型。

至於 YouTube,Google 已明確表示 Agentic video understanding 將在未來數月用於影片觀看頁面的 Ask YouTube 功能,以提供更高品質、能根據畫面內容回答的結果;這是已公布的產品路線,但不是目前所有使用者都已完成 rollout。

對開發者而言,現階段最明確的可用入口仍是 Gemini API;Enterprise 團隊則需額外留意 Preview 與 v1beta1 限制。

FAQ:Gemini Agentic Video 常見問題

Gemini Agentic Video 已經正式推出了嗎?

是。Google 於 2026 年 9 月 1 日正式宣布 Agentic video understanding,開發者目前可透過 Gemini API 在 Google AI Studio 與 Gemini Enterprise Agent Platform 使用。

哪些模型支援 Agentic Video?

目前官方列出的模型是 Gemini 3.7 Flash、Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite。其他 Gemini 模型仍可使用 static 影片處理,但不代表支援 agentic 模式。

Token 減少 88%、成本降低 66% 是保證嗎?

不是。這是 Google 在標準影片分析 benchmark 中觀察到的最高改善幅度,尤其以長影片較明顯。實際 Token、延遲、成本與正確率都會依影片內容、問題複雜度與模型導航策略改變。

Agentic Video 會另外收費嗎?

不會收取獨立的 Agentic Video 功能費,仍按所選 Gemini 模型的標準 API Token 費率計價。所謂成本下降主要來自模型可能只載入必要的影片內容。

Agentic Video 一定比 static 快嗎?

不一定。長影片與特定片段搜尋通常更適合 agentic;但 Google 文件提醒,對少於約 5 分鐘的短影片,內部導航與工具往返可能讓 TTFT 略微增加。

Gemini App 與 Ask YouTube 可以用了嗎?

開發者 API 已可使用。Gemini App 的 Flash/Flash-Lite 改善正在陸續推出;Google 也表示 Ask YouTube 將在未來數月導入這項能力。

官方來源

結論:把「最高省 66%」當成驗證假設,而不是承諾

Gemini Agentic Video Understanding 的關鍵,不是推出一個固定折扣,而是改變模型讀影片的方式:從預設 static 的 1 FPS 抽幀,延伸到依提示動態探索時間軸、選擇性查看逐字稿,以及調整影格率與解析度。

對長影片問答、片段定位與內容檢查工作,這有機會降低不必要的 Token 使用量。Google 的 benchmark 顯示最高可省 66% 成本,但真正的導入決策仍應回到自己的影片集、提示設計、正確率門檻與延遲需求,以 static 與 agentic 的 A/B 測試結果作為依據。

Comments

No comments yet. Why don’t you start the discussion?

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *