新闻 深度 观点 研究 数据 资源 活动 关于

Flash 还配叫 Flash 吗?DeepSeek 新模型参数近翻倍,GLM-5.3-Flash 默认长思考

DeepSeek V4.1-Flash 总参数从 284B 涨到 552B,GLM-5.3-Flash 强制开思考、默认最大推理。两个都叫 Flash,但快和便宜这两个承诺都不太成立了。

2026 年 9 月 10 日,DeepSeek 发布 V4.1-Flash,总参数 552B12。它接替的 V4-Flash 是 284B3。同一个 Flash 名字,体量涨了接近一倍。

再往前两周,8 月 26 日,智谱放出 GLM-5.3-Flash:320B 总参数、18B 激活,思考模式不能关,推理强度默认拉到最高456。

两个模型都叫 Flash。一个在”轻量”档里塞进了半万亿参数,一个默认就得想很久。Flash 这个名字本来暗示的两件事——快、便宜——现在都值得怀疑。

Flash 一开始的意思:小、快、便宜

2024 年 5 月 14 日,Google 发布 Gemini 1.5 Flash,官方说法是”比 1.5 Pro 更轻量,为大规模、快节奏的任务设计”7。定价也说明了它的位置:输入 $0.075、输出 $0.30(每百万 token)8。之后的 Flash 8B 更便宜,输入只要 $0.03758。

这就是 Flash 的原始定义:不是最强的,但是最快的、最便宜的。它不是 Pro 的缩水版,是那个”用得起”的版本。

2025 年:Flash 学会了”思考”

转折发生在 2025 年 3 月。Google 宣布”Gemini 2.5 都是思考模型”,并说接下来会把思考能力”直接做进所有模型”9。

从那一刻起,Flash 不再只是一个”跑得快的模型”。它开始先想一大段,再给出答案。而想出来的那些 token,是要计费的。

价格表上的痕迹

Google 从没公布过 Flash 的参数量,所以”变大了”这件事没法直接证明。但价格和计费方式的变化是可以查的。

表格 1:Gemini Flash 的价格变化(每百万 token,标准价)810

模型发布时间输入输出(含思考 token)
Gemini 1.5 Flash2024-05$0.075$0.30
Gemini 2.5 Flash2025-06$0.30$2.50
Gemini 3 Flash—$0.50$3.00
Gemini 3.5 Flash2026-05-19$1.50$9.00
Gemini 3.6 Flash2026-07-21$1.50$7.50
Gemini 3.7 / 3.8 Flash2026-09$0.75$3.75

从 1.5 Flash 到 3.5 Flash,输入价涨了 20 倍。3.5 Flash 也是被媒体单独点名的那个:它比被自己取代的 3 Flash 贵了 3 倍11。

这里有个容易被忽略的细节:输出的价格里,包含了模型的”思考 token”8。模型想得越久,账单越高,而这一部分你基本看不见。

DeepSeek V4.1-Flash:小档位里的大模型

回到今天的主角。V4.1-Flash 总参数 552B,每个 token 只激活其中一部分:输入侧 8B,输出侧 16B,是 MoE 结构12。上一代 V4-Flash 是 284B 总参数、13B 激活3。

总参数从 284B 到 552B,涨了约 94%,接近翻倍。激活参数没有跟着翻倍,改成了输入输出不对称的 8B / 16B2。另外它挂了一个 196B 的条件记忆模块 Engram,靠 token 匹配稀疏调用2。

其它数字:上下文 1M token,单次最多输出 384K token12。思考模式默认开启,默认强度是”高”,可选低 / 高 / 最高13。价格上,输入 $0.15–$0.30、输出 $0.60–$1.20(每百万 token,分低谷和高峰)12。

还有一个信号值得注意:从 9 月 14 日起,DeepSeek 会把旗舰 V4-Pro 的请求全部转到 V4.1-Flash 上,按 Flash 的价格计费1。换句话说,Flash 正在接手原来 Pro 的活。

GLM-5.3-Flash:默认就把思考拉满

智谱这边的做法更直接。GLM-5.3-Flash 是 320B 总参数、18B 激活,MIT 开源,上下文 1M45。

关键在”默认值”:它的思考模式只能开不能关,reasoning_effort 分低 / 高 / 最高,不设置就默认用最高6。官方甚至建议,要复现榜单成绩就保持最高强度6。

结果就是,它评测起来特别啰嗦。智谱自己引用 Artificial Analysis 的数据说,GLM-5.3-Flash 在智能指数 v4.1.1 上拿到 57 分,每个任务成本 $0.045(折扣价)4;Artificial Analysis 对它的评价则是明显偏慢、输出冗长14。它的 GPQA Diamond 得分 91.2,Terminal-Bench 2.1 拿到 84.3414。

表格 2:两个 Flash 的对比1122456

指标DeepSeek V4.1-FlashGLM-5.3-Flash
发布日2026-09-102026-08-26
总参数552B320B
激活参数8B(输入)/ 16B(输出)18B
上下文1M1M
思考模式默认开,默认”高”只能开,默认”最高”
输入价(每百万 token)$0.15–$0.30$0.15
输出价(每百万 token)$0.60–$1.20$0.50
开源模型卡公开MIT

两家的价格其实都不贵。真正变了的是别的地方:它们不再默认”快速给个答案”,而是默认”先想很久”。

慢,成了新的常态

“Flash 变慢”不是某一个模型的问题,是整条产品线的问题。

Epoch AI 统计过,推理模型每道题消耗的 token 大约是非推理模型的 8 倍,而且推理模型的回答长度还在以每年约 5 倍的速度增长15。另一份研究测得,在准确率接近的情况下,不同模型的输出长度能差 26 倍以上16。换句话说,挑一个”标价便宜”的模型,最后的总账单可能反而更高。

Google 自己在 3.8 Flash 的发布说明里也承认了:新模型”更用力”,在复杂任务上会执行更多推理步骤,“有时会使用更多 token 来把性能拉满”,并建议对成本敏感的用户降低推理强度,或者继续用 3.7 Flash17。

钛媒体把这种变化总结成一句话:价格表没动,账单动了。竞争的口径,正在从”每 token 价格”切换到”每任务成本”18。

参考来源

本篇文章引用了以下外部来源,所有数据和引述均可在对应链接中核实:

结论

Flash 这个词最早的意思很实用:快、便宜、够用。2026 年的 Flash 已经不是那个东西了。它现在更像”前沿模型里偏小的那一档”——参数可以很大,默认会想很久,价格不算高但也不算低。

下次看到某个模型叫 Flash,别默认它快。先看三个数:默认推理强度、激活参数、每任务成本。名字是营销,这三个数才是你实际会体验到的。

Footnotes

  1. DeepSeek 官方新闻页 — V4.1-Flash 发布公告、参数概况、V4-Pro 请求迁移时间 https://api-docs.deepseek.com/news/news260910 ↩ ↩2 ↩3 ↩4

  2. DeepSeek-V4.1-Flash HuggingFace 模型卡 — 552B/8B/16B、Engram 196B、架构与基准 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash ↩ ↩2 ↩3 ↩4 ↩5

  3. DeepSeek-V4-Flash HuggingFace 模型卡 — 上一代 284B 总参数 / 13B 激活 https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash ↩ ↩2

  4. Z.ai 官方博客 — GLM-5.3-Flash 发布、320B/18B、基准成绩 https://z.ai/blog/glm-5.3-flash ↩ ↩2 ↩3 ↩4 ↩5

  5. 智谱官方研究页(中文) — GLM-5.3-Flash 发布与开源信息 https://www.zhipuai.cn/zh/research/163 ↩ ↩2 ↩3

  6. zai-org/GLM-5 GitHub — 思考不可关闭、reasoning_effort 默认 max https://github.com/zai-org/GLM-5 ↩ ↩2 ↩3 ↩4

  7. Google 官方博客 — Gemini 1.5 Flash 发布(“lighter-weight… fast and efficient”),2024-05-14 https://blog.google/innovation-and-ai/products/google-gemini-update-flash-ai-assistant-io-2024/ ↩

  8. Google Gemini API 定价页 — 各代 Flash 输入/输出价格(含思考 token) https://ai.google.dev/gemini-api/docs/pricing ↩ ↩2 ↩3 ↩4

  9. Google 官方博客 — Gemini 2.5 思考模型,2025-03-25 https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-model-thinking-updates-march-2025/ ↩

  10. Google 官方博客 — Gemini 3.6 Flash 定价 $1.50/$7.50,2026-07-21 https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/ ↩

  11. XDA Developers — Gemini 3.5 Flash 比被它取代的模型贵 3 倍,2026-05-31 https://www.xda-developers.com/google-gemini-3-5-flash-costs-3x-model-replaced-cheap-ai-ending/ ↩

  12. DeepSeek 模型与定价页 — 上下文、最大输出、输入/输出价格 https://api-docs.deepseek.com/quick_start/pricing ↩ ↩2 ↩3

  13. DeepSeek 思考模式文档 — 思考默认开启、默认强度 high、low/high/max 档位 https://api-docs.deepseek.com/guides/thinking_mode ↩

  14. Artificial Analysis — GLM-5.3-Flash 独立评测:GPQA Diamond 91.2、速度偏慢且输出冗长 https://artificialanalysis.ai/models/glm-5-3-flash ↩ ↩2

  15. Epoch AI — 推理模型输出长度约 8 倍、年增约 5 倍 https://epoch.ai/data-insights/output-length ↩

  16. OckBench(arXiv 预印本) — 准确率接近时,输出长度可差 26 倍以上 https://arxiv.org/abs/2511.05722 ↩

  17. Google 官方博客 — Gemini 3.8 Flash(“works harder… might use more tokens”),2026-09-02 https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/ ↩

  18. 钛媒体 — “价格表没动,账单动了”,每任务成本口径 https://www.tmtpost.com/8126955.html ↩