2026 AI 日報(8月14日):Gemini 3.7 Flash、GPT‑5.6 Sol Ultrafast 與 DeepSeek Agent 全面加速
發佈日期: 2026 年 8 月 14 日
摘要
過去 24 小時的焦點並非單純的模型「更大」,而是各家把前沿能力推向更可部署的代理人工作流程。Google 發佈 Gemini 3.7 Flash,以低於前代導入價的定價強化程式與多步工具使用;OpenAI 則預覽讓 GPT‑5.6 Sol 最高快 14 倍的 Ultrafast 服務層級。DeepSeek 同步完成 V4‑Pro 正式上線,並開放其可組合的 Agent Harness,顯示模型能力、低延遲推論與可觀測執行框架已成為同一場競爭。13

本日觀察: 對生產環境而言,模型選型不應只比較基準分數;延遲、工具呼叫可靠性、可追蹤性,以及每次任務所需的推理成本,正逐漸成為同等重要的決策因子。
主要模型動態
Gemini 3.7 Flash:Google 把 Flash 系列推向程式與代理人主力
Google 於 8 月 13 日推出 Gemini 3.7 Flash,定位為面向程式開發與 Agent 工作流程的「主力型」模型。官方數據顯示,該模型在 FrontierCode 1.1 Main 為 43.6%,高於 Gemini 3.6 Flash 的 34.4%;在 DeepSWE v1.1 為 65.3%,高於前代的 49.0%。Google 也列出其在 WebDev Arena 的 Elo 為 1,588,較 3.6 Flash 的 1,538 提升。1
產品策略上,Gemini 3.7 Flash 的導入價至 2026 年底為每百萬輸入 Token 0.75 美元、每百萬輸出 Token 3.75 美元;2027 年 1 月 1 日起將調整為 1.50/7.50 美元。模型已透過 Gemini API、Google AI Studio、Android Studio 與 Gemini Enterprise Agent Platform 提供,Google 的長駐型個人代理服務 Gemini Spark 亦在發布當日切換至此模型。1
GPT‑5.6 Sol Ultrafast:前沿模型開始競逐即時互動
OpenAI 同日預覽了 Ultrafast 服務層級,讓 GPT‑5.6 Sol 在部分客戶的 API 工作負載中,最高可較標準處理快 14 倍,並達到每秒最高 750 個輸出 Token。該能力由 Cerebras 推理基礎設施支援,目前仍是限量預覽,OpenAI 表示將隨容量增加而擴大開放範圍。2
這項消息的意義在於,高智慧模型不再必然等同於長等待時間。OpenAI 所列舉的應用,包括事故應變、即時金融與資安分析、語音客服與電商互動;不過在正式導入前,團隊仍應以實際延遲分位數、成本與可靠性測試來驗證,而非把「最高 14 倍」視為所有工作負載都能達到的固定結果。2
| 動態 | 發佈/預覽狀態 | 核心訊號 | 開發者應關注的指標 |
|---|---|---|---|
| Gemini 3.7 Flash | 已發布 | 更強的程式、網頁與工作流程能力 | 任務成功率、單位任務 Token 成本 |
| GPT‑5.6 Sol Ultrafast | 限量預覽 | 前沿模型進入超低延遲互動場景 | p95 延遲、每秒 Token、服務可用性 |
| DeepSeek‑V4‑Pro | 已正式上線 | 可調推理投入與原生 Responses API | 工具調用成功率、尖離峰成本 |
| DeepSeek Harness | 開發者預覽、開源 | Agent 執行環境的可組合與可追蹤性 | 日誌完整度、插件穩定性、重播能力 |
DeepSeek:模型升級與 Agent Harness 一起發布
DeepSeek 宣佈 DeepSeek‑V4‑Pro 正式推出,重點放在代理人工作流的生產效益。V4‑Pro 與 V4‑Flash 都新增可調整的推理投入層級:簡單任務可選 low、日常 Agent 工作流可選 high、複雜任務則可選 max。新版本也支援原生 OpenAI Responses API,並針對 Codex 使用情境提供一鍵設定;在 DeepSeek App 與網頁端可透過 Expert Mode 使用。3
價格策略也值得提早納入排程:DeepSeek 表示,新的 API 價格將於 8 月 16 日 16:00 UTC 生效,並採用尖峰/離峰制度,離峰費率為尖峰的一半。對可延後執行的批次任務而言,這使工作排程本身成為成本優化的一環。3
另一項更具開發者意味的消息是 DeepSeek Harness 的開發者預覽。這套開放原始碼 Agent runtime 以 Cordis 插件架構為核心,讓模型、工具、Skills、工作階段、沙箱、儲存、排程與 UI 都能以插件方式替換或重組。它提供 Standard、Code、Minimal 與 Creator 四種運行模式,並以 append-only session log 記錄模型脈絡、推理、工具結果與子代理人排程,讓開發者可進行檢查、搜尋、重播與分支。這一方向反映 Agent 工程正在從「呼叫模型」轉向「管理可重現的執行系統」。4
Ollama 與 OpenRouter:本地代理與多模型路由的實作線索
雖然 Meta 的 Muse Glimmer 發布於 8 月 10 日,而非本期 24 小時窗口內的新公告,它仍是本日值得追蹤的本地部署消息。Ollama 已提供這個 Apache 2.0 授權的 30B 多模態 Agent 模型,支援超過 128K 上下文,並針對 Apple Silicon 透過 MLX engine 提供 muse-glimmer:30b-mlx 版本。Ollama 表示,搭配 DFlash 與影像輸入支援時,該模型在 Apple Silicon 上可快 1.5 至 1.8 倍;同時,模型可用於 Claude Code、Codex、OpenClaw、Hermes 及其他編碼/個人代理整合。5
對具備 24GB 統一記憶體的裝置,這類 30B 量化模型是「可實驗、但需量測」的選項,而非保證無壓力運行的預設。Meta 指出,其約 4-bit 的語言模型權重低於 20GB,但還必須容納 KV cache、影像編碼器、draft model 與系統本身;因此應先縮短上下文、以中低推理強度進行小型任務測試,再決定是否投入長時程代理工作流。6
多模型路由方面,OpenRouter 已列出 Gemini 3.7 Flash 的新版本頁面,也同步出現 Mistral Voxtral Mini 3B 2507 與 ByteDance Seedream 5.0 Lite 等音訊、影像模型條目。這代表開發者可在同一抽象層中,把程式/代理、語音理解與影像生成分配給不同供應商;但路由商的供應商可用性與價格可能變動,正式部署前仍應直接核對模型頁與 API 回傳資訊。7
結語:把「速度、代理能力、可觀測性」視為一組需求
本日三大發布所指向的共同方向很清楚:Google 將高效率模型定位為工程與 Agent 主力;OpenAI 把前沿模型推入即時互動;DeepSeek 則同時升級模型與 Agent 的執行底座。當一個任務要跨越檔案、網頁、程式碼與多個工具,真正的產品差異往往不是單輪回答,而是能否在可接受延遲與成本下,可靠地完成整段流程並留下可稽核軌跡。13
參考資料
本文由 Manus AI 依公開資料整理;模型價格、供應範圍與效能表現可能隨後續公告而調整。