发布成功


继DeepSeek后,小米MiMo大模型API迎来永久降价最高达99%!

发布时间:2026-05-28 阅读量:9538 来源: 发布人: suii

小米于5月27日宣布,对MiMo‑V2.5系列大模型的API调用价格实施永久性下调,最高降幅达99%,且新版定价不再区分上下文长度。


具体来看MiMo-V2.5-Pro:

百万tokens输入(缓存命中)只需要0.025元。

百万tokens输入(缓存未命中)3元。

百万tokens输出6元。


不仅如此,Token Plan方面,小米采取“加量不加价”策略,用户在Agent或Code场景下的可用 Token 数量将提升至原来的5-8倍,并把规则调整为“所见即所得”,简化了因换算导致的复杂计价逻辑。


这是继DeepSeek上周宣布V4-Pro永久降价至原价25%之后,国内头部大模型在短短一周内的又一次重磅价格调整。


国际比较看,DeepSeek与小米的最新定价已显著低于主流海外厂商。


国际主流模型方面,OpenAI GPT-4o的标准输入价格为每百万Tokens 2.5美元,输出价格为10美元;Claude Sonnet 4.6的输入为每百万Tokens 3美元,输出为15美元。


与简单的“烧钱”不同,小米此次降价的逻辑指向工程层面的成本结构优化。


据小米解释,基于 SGLang HiCache 完整支持 SWA(Sliding Window Attention),将 KV Cache 在 GPU 显存、CPU 内存、SSD 等多级存储之间的数据搬运量降低至优化前的近 1/7,并将可缓存 token 数量提升至优化前的近 5 倍,显著提升了缓存命中率和推理效率。此外,小米还通过优化专家方案、输入长度分桶策略等手段,进一步提升集群输入吞吐能力。


这与DeepSeek的降价逻辑一脉相承,都是通过架构创新以及推理系统的工程化优化,结构性地压低单位Token服务成本,再将红利让渡给开发者。


从行业情况来看,本轮国产大模型降价潮亦是伴随着应用方需求的变化,随着大模型正在从“聊天”进入“干活”的阶段,真正让开发者和企业用户焦虑的也不再只是一次问答金额,而是Agent在多轮推理、调用和自动化成本工作流等过程中持续燃烧的Token。


当百万Tokens价格被不断压低,国内大模型的竞争也会继续向下游传导。对于开发者来说,成本下降意味着更多Agent等应用供给会迎来井喷;对于厂商来说,低价背后则是更高的推理效率、更强的算力调度能力,以及更长周期的生态投入。


虽然价格战未必能直接判定模型性能的强弱,却能有效加速开发者侧的调用与渗透;小米MiMo此次大幅降价,正是国内大模型从技术竞速迈向“规模化应用”阶段的又一标志性注脚。


相关资讯
AEC-Q100 Grade 0 认证,纳芯微 NSM2025 电流传感器适配紧凑化新能源车电驱设计

纳芯微发布车规级线性电流传感器 NSM2025,搭载自研 BendingMag™聚磁技术,器件集成集磁片,搭配外部 U 型磁芯使用,符合 AEC-Q100 Grade 0 车规标准。针对新能源汽车电驱系统大电流检测、安装空间紧张的痛点,该产品支持和 PCB、母排灵活组合装配,适用于新能源车电机逆变器、BMS 以及各类过流检测场景。

是德科技推出 20GHz PSG XG7 双通道模拟信号发生器

是德科技推出全新 XG7 系列 PSG 模拟信号发生器,最高频率可达 20 GHz。这款仪器采用 2U 单机箱架构,内部搭载两路相互独立的信号通道,拥有优异低噪声性能与校准输出功率,便于工程师精准完成器件性能评估。紧凑双通道方案无需额外占用机架空间,有效提升测试容量。

是德科技助力加利福尼亚大学伯克利分校推进6G空口测试研究

是德科技助力加利福尼亚大学伯克利分校推进6G空口测试研究

苹果也受不了内存太贵,传iPhone 18 Pro系列10月减单15%

苹果iPhone系列手机10月订单较最初要求减少至15%!

传英伟达将不再向 GeForce 游戏显卡分配 GB202 GPU

英伟达将不再向GeForce RTX 50 系列游戏显卡分配 GB202,该 GPU 的供应将由 RTX PRO Blackwell 专业显卡独占。