2026-08-20 · waytomilky
8 月 13 日 Google 把 Gemini 3.7 Flash 的价格砍了一半。输入 $0.75/百万 token、输出 $3.75/百万 token,到 2026 年底。同一天,OpenAI 把 GPT-5.6 Sol 接入 Cerebras 跑 Ultrafast 模式,750 token/s。再往前一天,DeepSeek V4-Pro 正式 GA,定价 $1.32 / $3.96 每百万 token。
三件事凑一起,节奏感很明确:闭源在打价格战。

几个具体数字
- Gemini 3.7 Flash:$0.75 / $3.75 per 1M(input/output)。比上一代 3.6 Flash 便宜 50%。前 4 个半月特价。
- DeepSeek V4-Pro:$1.32 / $3.96 per 1M。8 月 16 日生效。
- DeepSeek V4-Pro-0813:综合 agent 评分在自家模型系列里最强,正在逼近闭源前沿。
- OpenAI GPT-5.6 Sol Ultrafast:750 output tok/s,是标准模式的 14 倍。有限预览。
涨价 vs 降价的两条路
有意思的不是"谁便宜",是"谁在什么情况下做这个决定"。
Google:把 Flash 系列做成"诱饵"——降价吸引开发者用,再用 Pro 系列赚钱。3.7 Flash 强调 coding 和 agent 工作流,调试和 issue 解决能力比上一代强。
DeepSeek:V4-Pro 比之前涨价了 50% 左右,但仍然比闭源前沿便宜 70%-80%。它的逻辑是"开源同步跟进 + 闭源 API 维持低价高质",让两个市场都占。
OpenAI:跟 Cerebras 合作 Ultrafast,承认"速度"是一种独立商品。$0.75/something vs Cerebras 驱动的 750 tok/s——不只是算账的问题,是工作流能跑多深的问题。
开源白送
这 8 月最狠的不是降价,是开源:
- 8/03 Qwen3.8-Max(2.4T MoE,Apache 2.0)
- 8/10 Meta Muse Glimmer 30B(Apache 2.0)
- 8/11 NVIDIA Nemotron 3.5 Lightning(Apache 2.0)
- 8/14 Qwen3.8-27B(Apache 2.0,单卡 4090 跑得动)
白嫖 27B、30B、2.4T 几个级别的开源模型,意味着大量场景"价格 = 0"是合理选择。
谁买单
价格战对消费者是好事,对企业用户是复杂题。
- 个人开发者 / 独立站长:开源够用就跑开源,省钱。
- 中小公司:选 Flash 级闭源 + 长上下文开源混合部署。
- 大公司:要么有自研,要么跟闭源谈"大批量折扣"。Anthropic 听说在谈 60 亿美元收购 Decart AI,就是冲着基础设施去的。
云厂商是最后的承担者。GPU 算力没便宜,电费没便宜,模型 API 一降再降——成本会向算力供给方转移。
我自己的判断
1. 价格战还会持续至少 2-3 个季度。8 月不是拐点,是新常态的起点。 2. "便宜 + 够用"会成主流。能用 Flash / Pro 级闭源处理的场景占大部分,Opus / GPT-5.6 满血只用在真需要上限的地方。 3. 真正受益的是开发者。Token 价格 1 年内降 5-10 倍,工作流能跑多深就有多大想象空间。
局限
- Ultrafast mode 还在 preview,只有部分客户能用到。
- Gemini 3.7 Flash 50% 折扣只到 2026 年底。
- DeepSeek V4-Pro 涨价 50% 之后,闭源 API 和开源 API 的成本结构差异在缩小。
小结
2026 年 8 月把"AI 模型价格"这件事从单点事件变成行业常态。下一次有人喊"AI 太贵",可以让他看下 8 月 13 日的 Gemini 3.7 Flash 定价。
评论交流
发表评论