2026 年的 AI 行业,原本有一个几乎被默认的判断:Token 会越来越贵。
理由看起来很充分。Agent 正在兴起,长上下文、多轮推理、代码生成、工具调用、文件解析会持续放大推理需求;算力供给并没有无限扩张;模型厂商的成本压力也越来越难藏住。
但过去一周,这个判断连续遭遇反向冲击。
5 月 22 日,DeepSeek 宣布 DeepSeek V4 Pro 永久降价。5 月 27 日 0 点,小米 MiMo-V2.5 系列 API 全球同步永久降价,最高降幅达到 99%。与此同时,小米 Token Plan 计费体系也同步调整,月费不变,但可用额度提升至原来的 5 至 8 倍。
这不是一次简单的促销,也不是厂商之间的情绪化跟价。它真正提出的问题是:当 AI 应用还没大规模盈利时,模型厂商为什么反而敢把 Token 价格打下来?
更进一步说,如果 Token 真的被重新定价,AI 行业的竞争重心会不会从“谁模型更强”,转向“谁能把推理成本压得更低”?
一场看似激进的降价,背后其实是大模型商业化逻辑的一次改写。
价格打穿,但不是人人都能享受最低价
小米这次降价最吸引眼球的数字,是“最高降幅 99%”。
根据小米公告,MiMo-V2.5 系列 API 进行永久降价,并且不再区分上下文长度。新价格已于北京时间 5 月 27 日 0 点全球同步生效。
但这里有一个容易被忽略的前提:99% 的降幅并不意味着所有调用都会按照最低价计费。真正决定成本的变量,是输入缓存是否命中。
以 MiMo-V2.5-Pro 为例,输入缓存命中时,价格降至约 0.025 元 / 百万 Tokens;如果缓存未命中,输入价格仍为 3 元 / 百万 Tokens,输出价格为 6 元 / 百万 Tokens。
也就是说,最低价格不是无条件开放,而是建立在“高缓存命中率”之上。
这让小米的降价显得更像一次精确的结构性调价,而不是粗暴补贴。它并没有把所有成本一刀切压低,而是把最有吸引力的价格留给了那些更适合缓存复用的场景:高重复上下文、高频 Agent、多轮代码任务、批量推理任务。
如果一个应用每次请求都高度随机、上下文无法复用、缓存命中率很低,那么它的实际成本并不会触及宣传中的最低点。反过来,如果一个应用大量重复调用相同系统提示词、项目代码、工具说明、历史上下文和文档内容,那么缓存命中价格就会变得非常有杀伤力。
Token Plan 的调整也是同样逻辑。
小米保留 Lite、Standard、Pro、Max 四档月费不变,分别为 39 元、99 元、329 元和 659 元,但 Credits 额度从原来的 0.6 亿、2 亿、7 亿、16 亿提升到 41 亿、110 亿、380 亿、820 亿。
表面看,这是“加量不加价”。但新的换算关系同样强调缓存命中:MiMo-V2.5-Pro 命中缓存只需 2.5 Credits / token,未命中缓存则需要 300 Credits / token,输出为 600 Credits / token。
换句话说,小米并不是单纯告诉市场“我更便宜”,而是在引导开发者改变调用方式:谁能更好地利用缓存,谁就能获得更低成本。
这才是这次降价真正值得关注的地方。
DeepSeek 先开枪,小米把价格锚钉住了

小米并不是第一个把缓存命中价格打到极低的玩家。
从时间线看,DeepSeek 已经提前完成了一轮价格下探。4 月 24 日,DeepSeek V4 预览版发布;4 月 25 日,V4-Pro 开启 2.5 折优惠;4 月 26 日,缓存命中价格降至首发价的十分之一;到 5 月 22 日,临时折扣转为永久降价,V4-Pro 永久降至原价四分之一。
一轮调整之后,DeepSeek-V4-Pro 的输入缓存命中价格从 0.1 元 / 百万 Tokens 降到 0.025 元 / 百万 Tokens。
小米 MiMo-V2.5-Pro 的快速跟进,





