AI你我的未來

2026 AI 日報(8月14日):Gemini 3.7 Flash、GPT‑5.6 Sol Ultrafast 與 DeepSeek Agent 全面加速

發佈日期: 2026 年 8 月 14 日

摘要

過去 24 小時的焦點並非單純的模型「更大」,而是各家把前沿能力推向更可部署的代理人工作流程。Google 發佈 Gemini 3.7 Flash,以低於前代導入價的定價強化程式與多步工具使用;OpenAI 則預覽讓 GPT‑5.6 Sol 最高快 14 倍的 Ultrafast 服務層級。DeepSeek 同步完成 V4‑Pro 正式上線,並開放其可組合的 Agent Harness,顯示模型能力、低延遲推論與可觀測執行框架已成為同一場競爭。13

AI 代理人與即時推論的概念插圖

本日觀察: 對生產環境而言,模型選型不應只比較基準分數;延遲、工具呼叫可靠性、可追蹤性,以及每次任務所需的推理成本,正逐漸成為同等重要的決策因子。

主要模型動態

Gemini 3.7 Flash:Google 把 Flash 系列推向程式與代理人主力

Google 於 8 月 13 日推出 Gemini 3.7 Flash,定位為面向程式開發與 Agent 工作流程的「主力型」模型。官方數據顯示,該模型在 FrontierCode 1.1 Main 為 43.6%,高於 Gemini 3.6 Flash 的 34.4%;在 DeepSWE v1.1 為 65.3%,高於前代的 49.0%。Google 也列出其在 WebDev Arena 的 Elo 為 1,588,較 3.6 Flash 的 1,538 提升。1

產品策略上,Gemini 3.7 Flash 的導入價至 2026 年底為每百萬輸入 Token 0.75 美元、每百萬輸出 Token 3.75 美元;2027 年 1 月 1 日起將調整為 1.50/7.50 美元。模型已透過 Gemini API、Google AI Studio、Android Studio 與 Gemini Enterprise Agent Platform 提供,Google 的長駐型個人代理服務 Gemini Spark 亦在發布當日切換至此模型。1

GPT‑5.6 Sol Ultrafast:前沿模型開始競逐即時互動

OpenAI 同日預覽了 Ultrafast 服務層級,讓 GPT‑5.6 Sol 在部分客戶的 API 工作負載中,最高可較標準處理快 14 倍,並達到每秒最高 750 個輸出 Token。該能力由 Cerebras 推理基礎設施支援,目前仍是限量預覽,OpenAI 表示將隨容量增加而擴大開放範圍。2

這項消息的意義在於,高智慧模型不再必然等同於長等待時間。OpenAI 所列舉的應用,包括事故應變、即時金融與資安分析、語音客服與電商互動;不過在正式導入前,團隊仍應以實際延遲分位數、成本與可靠性測試來驗證,而非把「最高 14 倍」視為所有工作負載都能達到的固定結果。2

動態 發佈/預覽狀態 核心訊號 開發者應關注的指標
Gemini 3.7 Flash 已發布 更強的程式、網頁與工作流程能力 任務成功率、單位任務 Token 成本
GPT‑5.6 Sol Ultrafast 限量預覽 前沿模型進入超低延遲互動場景 p95 延遲、每秒 Token、服務可用性
DeepSeek‑V4‑Pro 已正式上線 可調推理投入與原生 Responses API 工具調用成功率、尖離峰成本
DeepSeek Harness 開發者預覽、開源 Agent 執行環境的可組合與可追蹤性 日誌完整度、插件穩定性、重播能力

DeepSeek:模型升級與 Agent Harness 一起發布

DeepSeek 宣佈 DeepSeek‑V4‑Pro 正式推出,重點放在代理人工作流的生產效益。V4‑Pro 與 V4‑Flash 都新增可調整的推理投入層級:簡單任務可選 low、日常 Agent 工作流可選 high、複雜任務則可選 max。新版本也支援原生 OpenAI Responses API,並針對 Codex 使用情境提供一鍵設定;在 DeepSeek App 與網頁端可透過 Expert Mode 使用。3

價格策略也值得提早納入排程:DeepSeek 表示,新的 API 價格將於 8 月 16 日 16:00 UTC 生效,並採用尖峰/離峰制度,離峰費率為尖峰的一半。對可延後執行的批次任務而言,這使工作排程本身成為成本優化的一環。3

另一項更具開發者意味的消息是 DeepSeek Harness 的開發者預覽。這套開放原始碼 Agent runtime 以 Cordis 插件架構為核心,讓模型、工具、Skills、工作階段、沙箱、儲存、排程與 UI 都能以插件方式替換或重組。它提供 Standard、Code、Minimal 與 Creator 四種運行模式,並以 append-only session log 記錄模型脈絡、推理、工具結果與子代理人排程,讓開發者可進行檢查、搜尋、重播與分支。這一方向反映 Agent 工程正在從「呼叫模型」轉向「管理可重現的執行系統」。4

Ollama 與 OpenRouter:本地代理與多模型路由的實作線索

雖然 Meta 的 Muse Glimmer 發布於 8 月 10 日,而非本期 24 小時窗口內的新公告,它仍是本日值得追蹤的本地部署消息。Ollama 已提供這個 Apache 2.0 授權的 30B 多模態 Agent 模型,支援超過 128K 上下文,並針對 Apple Silicon 透過 MLX engine 提供 muse-glimmer:30b-mlx 版本。Ollama 表示,搭配 DFlash 與影像輸入支援時,該模型在 Apple Silicon 上可快 1.5 至 1.8 倍;同時,模型可用於 Claude Code、Codex、OpenClaw、Hermes 及其他編碼/個人代理整合。5

對具備 24GB 統一記憶體的裝置,這類 30B 量化模型是「可實驗、但需量測」的選項,而非保證無壓力運行的預設。Meta 指出,其約 4-bit 的語言模型權重低於 20GB,但還必須容納 KV cache、影像編碼器、draft model 與系統本身;因此應先縮短上下文、以中低推理強度進行小型任務測試,再決定是否投入長時程代理工作流。6

多模型路由方面,OpenRouter 已列出 Gemini 3.7 Flash 的新版本頁面,也同步出現 Mistral Voxtral Mini 3B 2507 與 ByteDance Seedream 5.0 Lite 等音訊、影像模型條目。這代表開發者可在同一抽象層中,把程式/代理、語音理解與影像生成分配給不同供應商;但路由商的供應商可用性與價格可能變動,正式部署前仍應直接核對模型頁與 API 回傳資訊。7

結語:把「速度、代理能力、可觀測性」視為一組需求

本日三大發布所指向的共同方向很清楚:Google 將高效率模型定位為工程與 Agent 主力;OpenAI 把前沿模型推入即時互動;DeepSeek 則同時升級模型與 Agent 的執行底座。當一個任務要跨越檔案、網頁、程式碼與多個工具,真正的產品差異往往不是單輪回答,而是能否在可接受延遲與成本下,可靠地完成整段流程並留下可稽核軌跡。13


參考資料

本文由 Manus AI 依公開資料整理;模型價格、供應範圍與效能表現可能隨後續公告而調整。