2026 年 9 月大模型性价比横评:从 Gemini 3.7 到 DeepSeek-V4,谁在价格战里真让利
如果说 2024-2025 年的大模型竞争主题是"谁的跑分高",那么 2026 年 9 月的主题已经明确切换为:同等能力下,谁的价格更低。
随着 Anthropic 在 8 月把 Fable 5.1 的定价永久锚定在输入 $10 / 输出 $50(每百万 token),各家厂商的定价策略出现了明显的分层。我基于各厂商公开的定价信息,把当前主力模型的价格整理如下。
主力模型公开定价对照(每百万 token,美元)
| 模型 | 输入 | 输出 | 厂商 | 备注 |
|---|---|---|---|---|
| MiMo-V2.5 | 0.40 | 2.00 | 小米 | 入门档最低价 |
| DeepSeek-V4-Flash(高峰) | 0.44 | 1.32 | DeepSeek | 输出价最具竞争力 |
| DeepSeek-V4-Pro(非高峰) | 0.66 | 1.98 | DeepSeek | 分时定价红利 |
| Gemini 3.6 Flash | 0.75 | 3.75 | 促销价持续至 2026-12-31 | |
| Gemini 3.7 Flash | 0.75 | 3.75 | 同上,12/31 后回调 | |
| LongCat-2.0(标准) | 0.75 | 2.95 | LongCat | 输出价低于 Gemini Flash |
| MiMo-V2.5 Pro(≤256K) | 1.00 | 3.00 | 小米 | 长上下文档 |
| Claude Fable 5.1 | 10.00 | 50.00 | Anthropic | 能力天花板档 |
注:各厂商促销与折扣可能随时间调整,以官方定价页为准。
三个值得注意的定价策略
一、Google 的"限时锚定"打法
Gemini 3.6 / 3.7 Flash 的 $0.75/$3.75 是标注了截止日期(2026 年 12 月 31 日)的促销价。这种"限时锚定"的意图很明显:先用低价把开发者生态圈进来,年底再视竞争态势决定回调幅度。如果你的架构深度绑定 Flash 系,建议现在就把 12/31 之后的成本压力测试做掉。
二、DeepSeek 的分时定价
DeepSeek-V4 系列延续并深化了"高峰/非高峰"双轨定价:Flash 高峰期 $0.44/$1.32,V4-Pro 非高峰 $0.66/$1.98。对任务可调度性强的批量场景(离线数据处理、夜间批量生成),错峰调度本身就是一项优化工程,实际成本可以再压 30% 以上。
三、国产新玩家的"贴地"入场
小米 MiMo-V2.5 以 $0.40 的输入价格成为表格中的最低档,输出 $2.00 同样激进。配合 Pro 版的 256K 长上下文支持,"手机厂做大模型"这条线已经从概念走到了有竞争力的商用定价。
按场景选型的务实建议
结合 9 月各家的公开基准表现,不同场景的性价比答案已经很清晰:
- 批量内容生产(走量):Gemini 3.8 Flash 是公认的 price-performance 首选
- 离线批处理(可调度):DeepSeek-V4 非高峰档,错峰红利最大化
- 事实锚定类商业写作:GPT-5.5,OpenAI 在这个细分场景的差异化依然稳固
- 虚构/创意写作:Kimi K3 在 EQ-Bench 拿到 2070.6 分(第四名),中文创作场景尤其值得试
- 复杂编码与智能体工作流:Claude Fable 5.1,贵但强,用对场景就是省钱
- 预算敏感的通用任务:MiMo-V2.5 / DeepSeek-V4-Flash
价格战背后:行业逻辑变了
价格战的表面是让利,深层是推理成本的持续摊薄。稀疏注意力机制(DeepSeek 的 NSA、月之暗面的 MoBA 这类架构优化)已经成为降本的主流技术路径——用"只听关键发言"的方式替代"听全场发言",单次推理的计算量大幅下降。
中国信通院在《人工智能产业发展研究报告》中的判断与此呼应:行业已不再单纯依靠参数规模实现性能突破,精细化机制、算法架构、训练方法的优化成为主要提升方向。翻译成采购语言:降本空间还会持续释放,今天的"低价"可能只是明天的"常态价"。
给开发者的三个动作
- 把模型选型写成配置而非代码:价格战时代,换模型的频率会越来越高
- 为分时定价做调度能力:这是 DeepSeek 们白送的 30% 折扣
- 盯紧 12 月 31 日:Gemini Flash 促销到期是年内最大的成本变量
常见问题 FAQ
Q1
现在最便宜的主流模型是哪个?| 按公开定价,小米 MiMo-V2.5 输入 $0.40/百万 token 为最低档;DeepSeek-V4-Flash 高峰输出价 $1.32 是输出侧最低。
Q2
Gemini Flash 促销价什么时候结束?| 2026 年 12 月 31 日。届时 3.6/3.7 Flash 的 $0.75/$3.75 定价可能回调,重度用户建议提前做成本压测。
Q3
Claude Fable 5.1 这么贵值得用吗?| 取决于场景。它在智能体科研、专业交付等高价值场景的能力领先明显,复杂任务上"一次做对"比便宜模型反复重试更省总成本。
Q4
价格还会继续降吗?| 架构侧的降本(稀疏注意力等)仍在推进,行业报告也确认效率优化是主线。趋势上,同等能力的单价大概率继续下探。
