
目錄
GPT 與 Claude 接連大動作更新後,大家原本都在等 Google 端出傳聞中的 Gemini 3.5 Pro。沒想到內測表現不如預期,發布日兩度延後,最後在 2026 年 7 月 21 日率先亮相的,反而是 Flash 系列——Google 一次推出三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite,以及專攻資安的 3.5 Flash Cyber。
這次更新,Google 主打的三個關鍵字——效率、延遲、可靠度——其實都指向同一件事:讓企業能大規模地跑 AI Agent。EgentHub 站在企業導入 AI 的第一線,最在意的也正是模型能不能又便宜又穩地跑在正式流程裡。以下就為各位整理本次三款模型的重點。
重點整理 Takeaway
- 3.6 Flash 更省更便宜: 輸出 Token 較 3.5 Flash 減少 17%,部分測試(DeepSWE)甚至省下高達 65%,單價更降到每百萬輸出 Token 7.5 美元。
- 3.5 Flash-Lite 追求極速: 每秒輸出 350 個 Token,是 3.5 系列裡最快的一員,價格低到每百萬輸出 Token 2.5 美元,專為高吞吐量任務而生。
- 小模型逆襲大模型: 3.5 Flash-Lite 在多項 Agent 與程式測試上,反而勝過上一代的 3 Flash,速度更快、能力也更強。
- Computer Use 內建化: 兩款模型都把「操作電腦」變成 API 原生工具,讓 Agent 執行任務更穩定。
- 3.5 Flash Cyber 專攻資安: 搭配 CodeMender 專門找漏洞、補漏洞,但只開放給政府與可信賴夥伴,採限量試行。
3.6 Flash:更划算,也更強
過去企業導入 AI,最常卡在速度、能力與價格三者之間的拉扯:聰明的模型往往又慢又貴,換成便宜的又擔心變笨。
3.6 Flash 這次的做法,是在提升程式與知識工作能力的同時,用更少的推理步驟與工具呼叫來完成多步驟任務,因此能少燒 Token、把價格壓下來。
具體來說,根據 Artificial Analysis Index,3.6 Flash 完成同一項任務所消耗的輸出 Token,比 3.5 Flash 少了 17%;在 DeepSWE 這類程式測試裡,某些情況甚至省下高達 65%。
價格也一起下修。相較於 3.5 Flash 的每百萬輸入 1.5 美元/輸出 9 美元,3.6 Flash 的輸出降到每百萬 7.5 美元、輸入維持在 1.5 美元。換算下來,跑單一 Agent 任務的成本更低,對於想把 AI Agent 開到全公司規模的企業,是實打實的 cost down。
能力面的實測數據同樣有明顯進步:
- 程式精準度 DeepSWE 從 37% 拉到 49%,減少不必要的改動與重複執行的迴圈。
- 機器學習研究 MLE Bench 從 49.7% 躍升到 63.9%。
- 操作電腦 OSWorld-Verified 從 78.4% 進步到 83.0%。
- 知識工作 GDPval-AA v2 從 1349 提升到 1421。
3.5 Flash-Lite:把速度推到極致
3.5 Flash-Lite 是專為「量大、要快」而生的短跑選手。
企業裡很常見這樣的情境:要處理的不是一道難題,而是幾萬筆相同的小任務——大量搜尋、文件批次處理、資料萃取。這時候真正的重點,是誰能跑得又快又省。
Flash-Lite 正是為此打造。它是 3.5 系列裡最快的模型,每秒可輸出 350 個 Token;價格更壓到每百萬輸入 0.3 美元、輸出 2.5 美元。
開發者還能依任務調整思考等級:小任務走低延遲、低成本模式,遇到複雜的多步驟子任務再切到高思考檔。更有意思的是,這隻「輕量版」在不少測試上把前代大哥比了下去:
- 程式與終端操作 Terminal-Bench 2.1 從 31% 大幅拉到 54%。
- 長文本理解 GDM-MRCR v2 從 60.1% 提升到 72.2%。
- 真實任務執行 GDPval-AA v2 從 642 暴增到 1140。
過去我們總覺得「小模型等於將就」,如今 3.5 Flash-Lite 在多項 Agent 與程式評測上反超上一代的 3 Flash,等於是說:在高流量的正式環境裡,你可以用更小、更便宜的模型,換到比舊旗艦更好的結果。
3.5 Flash Cyber:專門抓漏洞的資安特化款
資安圈正在發酵一個矛盾:AI 找漏洞的速度,已經快過人類補漏洞的速度。
Google 這次的解法,是推出 3.5 Flash Cyber——一款以 3.5 Flash 為底、專門微調來找漏洞與修漏洞的特化模型,成本比大模型更低。
它會搭配程式安全 Agent「CodeMender」一起運作,由多隻 Cyber 模型分工協作,最後彙整成一份報告。在知名資安評測 CyberGym 上,這套組合已經來到前段班水準。
不過,這類技術本身是兩面刃。因此 3.5 Flash Cyber 只會透過 CodeMender,限量開放給政府與可信賴夥伴試用,目的是讓防守方搶在漏洞被利用之前先補起來,同時把被濫用的風險降到最低。
越便宜的模型,越考驗搭配
這波更新聚焦在輕量模型,Google 的敘事重心放在——Agent 時代能不能又快、又省、又穩地大規模執行。當同一件任務的成本一路往下掉、可選的模型越來越多,企業真正的難題也隨之轉變:從「該用哪一顆模型」,變成「怎麼把對的模型,配到對的任務上」。
這正是 EgentHub 想幫企業解決的問題。透過自有平台的多模型自由配置,你可以隨新模型上線即時切換、依任務挑選最適合也最划算的模型;再加上細緻的 RBAC 權限管理與 MCP 串接能力,讓 AI Agent 能安全地接進企業真實流程。模型會一直換,但一套具備彈性的整合架構,能讓你每次都吃到紅利,而不必每次都從頭來過。