欧美无套内射-欧美无砖专区-欧美五月婷婷-欧美午夜不卡-欧美午夜不卡影院-欧美午夜-欧美午夜成人网站-欧美午夜传媒-欧美午夜电影-欧美午夜福利-欧美午夜福利视频-欧美午夜福利影院

您好,歡迎光臨陜西某某偉業(yè)體育文化傳播有限公司網(wǎng)站!

新浪微博| 騰訊微博| 網(wǎng)站地圖| 羅福莉劃重點(diǎn),小米大模型降價(jià)99%的秘籍公開_MiMo-V_推理_Cache_北京永亮緣裝飾有限公司 鐵藝欄桿|北京電動(dòng)伸縮門|房山區(qū)伸縮門
在線咨詢熱線:
0510-888888888
聯(lián)系我們
服務(wù)熱線
029-87375858
電話:15319958588
咨詢微信:admin-2016
地址:西安市蓮湖區(qū)西大街宏府安定廣場(chǎng)58號(hào)樓5858室
當(dāng)前位置:當(dāng)前位置: 首頁 >

羅福莉劃重點(diǎn),小米大模型降價(jià)99%的秘籍公開_MiMo-V_推理_Cache
瀏覽: 發(fā)布日期:2026-06-01 15:25:05

智東西

作者 | 程茜

編輯 | 李水青

智東西6月1日?qǐng)?bào)道,5月30日,小米首次公開MiMo-V2.5系列API永久降價(jià)99%的技術(shù)秘籍,其博客提到,這也是業(yè)內(nèi)首篇全面覆蓋Hybrid SWA+MoE+多模態(tài)組合架構(gòu)的大規(guī)模工程落地方案。

其降價(jià)的核心技術(shù)基礎(chǔ)是,小米MiMo大模型團(tuán)隊(duì)圍繞Hybrid SWA+MoE+多模態(tài)的復(fù)合架構(gòu),系統(tǒng)性重構(gòu)從KV Cache管理、分級(jí)緩存、前綴緩存到調(diào)度策略與Prefill/Decode鏈路的完整推理?xiàng)#琄V Cache存儲(chǔ)壓縮至同級(jí)方案的約1/7,在長(zhǎng)序列場(chǎng)景下推理成本大幅下降。

5月30日,小米MiMo大模型負(fù)責(zé)人羅福莉在X發(fā)帖介紹了這篇技術(shù)論文,并提到,經(jīng)實(shí)際生產(chǎn)流量驗(yàn)證,這些優(yōu)化措施使有效KV Cache容量提升了近5倍,主流測(cè)試框架下的服務(wù)器端緩存命中率平均達(dá)到93%~95%結(jié)合MoE配置調(diào)優(yōu)和多模態(tài)推理優(yōu)化,這些措施能夠?qū)崿F(xiàn)更高效的長(zhǎng)上下文推理,也是近期小米MiMo API降價(jià)的部分原因。

小米發(fā)布題為《MiMo-V2.5系列推理全鏈路優(yōu)化:將Hybrid SWA效率推向極致》的技術(shù)博客是對(duì)其上周MiMo-V2.5系列API永久降價(jià)、TokenPlan計(jì)費(fèi)體系優(yōu)化等一系列舉措的最新回應(yīng)。

5月27日,小米官宣MiMo-V2.5系列API永久降價(jià),TokenPlan計(jì)費(fèi)體系優(yōu)化后其用量提升至原來的5~8倍。小米MiMo幾乎直接對(duì)標(biāo)DeepSeek API價(jià)格。更新價(jià)格后,MiMo-V2.5輸入緩存命中價(jià)格降至0.02元/百萬tokens,未命中輸入為1元/百萬tokens,輸出價(jià)格為2元/百萬tokens;MiMo-V2.5-Pro則分別為0.025元、3元和6元。

▲DeepSeek與小米MiMo API價(jià)格對(duì)比表(智東西制表)

同日,羅福莉在社交平臺(tái)X上就預(yù)告了技術(shù)報(bào)告即將發(fā)布,并提前劃了重點(diǎn)。她提到輸入(緩存命中)部分降幅高達(dá)99%,根本原因是其推理框架現(xiàn)在支持SWA的KVCache優(yōu)化;輸入(緩存未命中)和輸出價(jià)格降低60%-80%是因?yàn)镠ybrid SWA架構(gòu)中SWA層占比為6/7,其計(jì)算量約為Full Attention的1/7。此外,在API大幅降價(jià)的同時(shí),小米仍能基本實(shí)現(xiàn)收支平衡。

一、MiMo-V2.5核心架構(gòu),計(jì)算量?jī)H為全注意力機(jī)制1/7

小米在技術(shù)博客中提到,MiMo-V2.5系列模型的推理效率是多維度協(xié)同優(yōu)化的結(jié)果。

其核心架構(gòu)是Hybrid SWA+MoE+多模態(tài)架構(gòu),并系統(tǒng)性重構(gòu)了KV Cache管理、分級(jí)緩存、前綴緩存樹,優(yōu)化調(diào)度策略及Prefill/Decode鏈路,最終將其理論效率優(yōu)勢(shì)真正兌現(xiàn)到生產(chǎn)環(huán)境。

小米研究人員選擇Hybrid SWA+MoE+多模態(tài)架構(gòu)的原因是,MiMo-V2.5設(shè)計(jì)之初的目標(biāo)就是,訓(xùn)練出一個(gè)在長(zhǎng)文推理場(chǎng)景下既足夠強(qiáng)、又足夠高效的模型。

傳統(tǒng)全局注意力(Full Attention)架構(gòu)無法兼顧,Hybrid SWA的核心思想是在局部窗口注意力(SWA)與全局注意力之間進(jìn)行分層混合:絕大多數(shù)層僅計(jì)算局部窗口內(nèi)的注意力,只有少量關(guān)鍵層保留全局視野。理論上,這種結(jié)構(gòu)能夠?qū)ttention的計(jì)算復(fù)雜度壓低到接近線性,同時(shí)依然維持對(duì)長(zhǎng)程依賴關(guān)系的建模能力。

但想要充分發(fā)揮Hybrid SWA架構(gòu)的推理效率優(yōu)勢(shì)還需要調(diào)度策略、Prefill/Decode執(zhí)行鏈路、多模態(tài)、MoE架構(gòu)的全鏈路優(yōu)化。

先以MiMo-V2.5-Pro為例,具體看下Hybrid SWA架構(gòu)的推理效率優(yōu)勢(shì)。

MiMo-V2.5-Pro模型共70層,其中10層為Full Attention、60層為SWA,SWA的滑動(dòng)窗口大小是128。

與Full Attention相比,Hybrid SWA架構(gòu)中SWA層占比為6/7,因此其計(jì)算量約為Full Attention的1/7。

此外,由于SWA層僅需保留滑動(dòng)窗口內(nèi)KV,無需存儲(chǔ)全序列,因此KVCache占用同樣下降至接近1/7。在長(zhǎng)序列下,KV Cache的體積可能遠(yuǎn)超模型參數(shù),因此KV Cache存儲(chǔ)的減少幾乎直接等價(jià)于長(zhǎng)序列場(chǎng)景下decode成本的降低。

其技術(shù)博客提到,不同模型架構(gòu)KV Cache存儲(chǔ)、訪存模式都存在差異,其故估算了多個(gè)國(guó)產(chǎn)模型的KV Cache大小,MiMo-V2.5-Pro和MiMo-V2.5在KV Cache上位列國(guó)產(chǎn)模型第二,僅次于DeepSeek-V4-Pro和Flash。

因?yàn)榇嬖谂c序列長(zhǎng)度無關(guān)的固定計(jì)算與訪存開銷,所以實(shí)際成本差異并不嚴(yán)格等價(jià)于KV Cache規(guī)模比例。但在長(zhǎng)上下文場(chǎng)景下,整體趨勢(shì)一致:短文性價(jià)比接近,序列越長(zhǎng)推理成本優(yōu)勢(shì)越大。

二、羅福莉提前發(fā)帖劃重點(diǎn),即使API價(jià)格下調(diào)也能收支平衡

5月27日,小米官宣降價(jià)時(shí),羅福莉就在社交平臺(tái)X上發(fā)帖,為MiMo API的降價(jià)原因劃了重點(diǎn)。

MiMo-V2.5降價(jià)幅度最大的是輸入(緩存命中)部分,降幅高達(dá)99%,根本原因是其推理框架現(xiàn)在支持SWA的分層鍵值緩存優(yōu)化。生產(chǎn)環(huán)境推理引擎測(cè)試表明,此優(yōu)化可將緩存token容量提升5倍,相當(dāng)于緩存成本降低80%。結(jié)合混合模型中多個(gè)全注意力模塊之間的緩存讀取重疊,實(shí)際成本進(jìn)一步降低。

輸入(緩存未命中)和輸出價(jià)格降低60%-80%是因?yàn)镾WA稀疏度比,70層MiMo-V2.5-Pro的預(yù)填充計(jì)算量大致相當(dāng)于10層GQA模型。這使其最初的推理成本遠(yuǎn)低于行業(yè)平均水平,帶來2~3倍定價(jià)利潤(rùn)。

她還提到,在API價(jià)格大幅下調(diào)的情況下,小米的生產(chǎn)推理引擎幾乎滿負(fù)荷運(yùn)轉(zhuǎn),基本能夠?qū)崿F(xiàn)收支平衡。他們之前曾建議大模型公司不要“盲目降價(jià)”,因?yàn)闃O少有模型架構(gòu)和推理優(yōu)化方案能夠保證API成本不虧損。如果未來出現(xiàn)更多能夠節(jié)省計(jì)算***和KV Cache的架構(gòu),以及能夠進(jìn)一步降低API成本的更完善推理基礎(chǔ)設(shè)施,這將在行業(yè)內(nèi)形成一個(gè)良性循環(huán)。

此外,經(jīng)濟(jì)實(shí)惠且高性能的模型API將推動(dòng)真正、持續(xù)且大規(guī)模的推理需求。這種上游需求將帶動(dòng)整個(gè)AI基礎(chǔ)設(shè)施鏈發(fā)展。

三、KV Cache系統(tǒng)重構(gòu):提升模型實(shí)際命中率

為了讓SWA更加可用,研究人員圍繞KV Cache進(jìn)行了系統(tǒng)性重構(gòu),此前其選擇的臨時(shí)方案都無法讓推理系統(tǒng)真正“理解”Hybrid SWA的存儲(chǔ)特性。

Hybrid SWA帶來的核心存儲(chǔ)矛盾是,F(xiàn)ull Attention層需要保留全序列KV(O(N)),而SWA層僅需維護(hù)滑動(dòng)窗口內(nèi)KV(O(W))。在傳統(tǒng)單一KV pool設(shè)計(jì)下,系統(tǒng)必須按O(N)為所有層統(tǒng)一分配顯存,使SWA的窗口稀疏性無法被利用,實(shí)際存儲(chǔ)效率退化為Full KV Cache的近似實(shí)現(xiàn)。

在此基礎(chǔ)上,其***用了雙池分治、前綴緩存樹重構(gòu)、GCache***緩存綜合優(yōu)化。

分池優(yōu)化是將KV Cache拆分為Full Attention與SWA兩個(gè)獨(dú)立池,并在系統(tǒng)層進(jìn)行統(tǒng)一抽象,這使得SWA KV Cache在系統(tǒng)層面實(shí)現(xiàn)嚴(yán)格O(W)存儲(chǔ)約束,使整體KV Cache容量效率提升約7倍,主流推理框架也都***用了類似的實(shí)現(xiàn)方案。

SWA-aware前綴緩存樹優(yōu)化包括匹配規(guī)則升級(jí)為“窗口安全長(zhǎng)度”、淘汰路徑與請(qǐng)求生命周期綁定、節(jié)點(diǎn)同時(shí)承載兩套索引。

SWA把KV體積壓到1/7是容量層面的收益,命中率是復(fù)用層面的收益,兩者乘起來是prefill階段實(shí)際計(jì)算成本的曲線。引入“窗口安全長(zhǎng)度”匹配規(guī)則后,同樣token容量的KV Cache命中率理論上是小幅度下降的,但同樣存儲(chǔ)容量下的token數(shù)量達(dá)到數(shù)倍,實(shí)際命中率大幅度提升。

GCache是小米存儲(chǔ)團(tuán)隊(duì)開發(fā)的高性能通用緩存,它是構(gòu)建存儲(chǔ)“訓(xùn)推一體”體系重要的一環(huán),同時(shí)支持GPU顯存、CPU內(nèi)存和NVMe SSD的高性能分布式緩存系統(tǒng)。存儲(chǔ)成本方面,GCache優(yōu)先***用在GPU機(jī)器上混布的方式,接管了Prefill和Decode節(jié)點(diǎn)的部分內(nèi)存,和機(jī)器自帶的數(shù)塊NVMe SSD,額外的存儲(chǔ)成本為0。

得益于這些優(yōu)化,小米研究人員觀測(cè)到,在優(yōu)質(zhì)harness框架下,服務(wù)端KV Cache命中率平均可達(dá)93%;對(duì)于高強(qiáng)度、長(zhǎng)周期使用的個(gè)人用戶,該指標(biāo)可達(dá)95%乃至更高。

四、調(diào)度優(yōu)化:L2緩存命中率提升25%,單機(jī)輸入吞吐提升30%

在調(diào)度優(yōu)化方面,小米希望通過匹配調(diào)度和計(jì)算鏈路,讓省出來的顯存空間和算力余量真正發(fā)揮作用。

在此基礎(chǔ)上,小米開發(fā)了可動(dòng)態(tài)擴(kuò)展的無狀態(tài)調(diào)度器LLM-Router,通過使用Redis作為中心化存儲(chǔ),避免單服務(wù)故障后的KV Cache調(diào)度回退現(xiàn)象,穩(wěn)定保證緩存命中率。

首先是KV Cache與負(fù)載親和調(diào)度,由于HiCache對(duì)于L2的命中率非常敏感,如果L2沒有命中,就需要去L3查找并拉取KV Cache,等待拉取結(jié)束后才能對(duì)該請(qǐng)求進(jìn)行推理。Router中通過將分發(fā)過的請(qǐng)求維護(hù)在Radix前綴樹中,實(shí)現(xiàn)了KV Cache親和調(diào)度。在多個(gè)Prefill實(shí)例間優(yōu)先選擇已經(jīng)緩存當(dāng)前請(qǐng)求前綴的節(jié)點(diǎn),并同時(shí)兼顧負(fù)載均衡來避免熱點(diǎn)傾斜。

該策略上線后,將L2的緩存命中率提升了約25%,單機(jī)輸入吞吐提升了約30%。同時(shí)其引入計(jì)算量感知優(yōu)先調(diào)度,優(yōu)先處理真實(shí)計(jì)算token數(shù)更少的請(qǐng)求,輔以等待時(shí)間懲罰機(jī)制避免饑餓,TTFT P90降低30%。

其次是關(guān)于Prefill鏈路本身的計(jì)算效率,早期SWA KV Cache需保存所有token的KV Cache,導(dǎo)致EP被迫偏大;優(yōu)化后僅需保存SWA部分token,研究人員將EP縮減至原先的1/2,端到端性能提升約40%。

為緩解負(fù)載不均衡問題,研究人員還***用***長(zhǎng)度分桶策略(0–64K/64K–256K/256K–1M),將負(fù)載特征相近的請(qǐng)求聚合至同一桶內(nèi)做計(jì)算,提升了線上prefill的平均吞吐。

MiMo-V2.5系列模型均***用MoE架構(gòu),還需要考慮prefill階段的專家負(fù)載均衡問題。由于該模型在預(yù)訓(xùn)練階段引入了負(fù)載均衡的訓(xùn)練目標(biāo)、且訓(xùn)練較為穩(wěn)定,模型在訓(xùn)練時(shí)已學(xué)習(xí)到較為均勻的專家分配策略。

推理階段,在未啟用任何專家負(fù)載均衡策略的條件下,各層平均專家負(fù)載度(一層中所有rank的平均token數(shù)與該層rank最大token數(shù)之比)約為0.85,處于較優(yōu)分布水平。

五、Decode優(yōu)化:顯存+MTP雙管齊下,KVCache有效容量提升近5倍

Decode階段的核心瓶頸是顯存被KV Cache占滿導(dǎo)致batch size無法擴(kuò)展,GPU算力打不滿。因此其進(jìn)行了顯存優(yōu)化和MTP優(yōu)化。

顯存優(yōu)化包括Decode KV Cache完整支持SWA,使得KV Cache有效容量提升近5倍;PD分離中KV Cache預(yù)分配優(yōu)化,將尚未啟動(dòng)的請(qǐng)求的prealloc過程從GPU顯存遷移至CPU內(nèi)存,decode實(shí)際啟動(dòng)時(shí)才搬入顯存,消除***預(yù)占造成的浪費(fèi);CUDA Graph顯存調(diào)優(yōu),能優(yōu)化CUDA Graph參數(shù)減少空間浪費(fèi),使可用顯存提升。

MiMo-V2.5系列模型原生支持3層MTP加速decode輸出,其還在prefill階段引入MTP支持并對(duì)HiCache L2/L3進(jìn)行專項(xiàng)適配和優(yōu)化,這使得decode前期MTP加速效果提升:第0–128 token加速比達(dá)2.3倍,第128–256 token加速比達(dá)1.5倍,降低了智能體場(chǎng)景下的真實(shí)decode成本。

六、多模態(tài)推理優(yōu)化:Encoder吞吐提升至2倍

最后是多模態(tài)推理優(yōu)化。MiMo-V2.5系列支持視覺、音頻、***跨模態(tài)理解。

基于SGLang社區(qū)v0.5.7 EPD方案,小米研究人員圍繞MiMo-V2.5做了大量EPD分離方面的工程優(yōu)化與穩(wěn)定性修復(fù),在延時(shí)保持不變的情況下,將Encoder吞吐提升至2倍。

具體的優(yōu)化包括Encoder支持跨請(qǐng)求組Batch,多個(gè)請(qǐng)求的image/audio融合為一次Forward再按請(qǐng)求切分返回;圖片預(yù)處理遷移至GPU消除大圖場(chǎng)景下CPU瓶頸;***解碼切分為多chunk多線程并行處理,1小時(shí)***端到端延時(shí)從156秒降至23秒;通過一致性哈希和機(jī)內(nèi)共享內(nèi)存實(shí)現(xiàn)Embedding緩存共享,整體Encoder吞吐提升至2倍。

結(jié)語:全鏈路技術(shù)優(yōu)化或驅(qū)動(dòng)大模型API降價(jià)潮

小米MiMo-V2.5系列API最高降幅99%,核心依托Hybrid SWA+MoE復(fù)合架構(gòu)與全鏈路推理?xiàng)?yōu)化,首次實(shí)現(xiàn)了系統(tǒng)性的推理鏈路優(yōu)化。此次,DeepSeek先將V4-Pro永久降價(jià)75%,小米五天后跟進(jìn)MiMo-V2.5最高降99%,直接全面對(duì)齊。

這一輪價(jià)格戰(zhàn)或倒逼全行業(yè)重構(gòu)定價(jià)體系,API服務(wù)轉(zhuǎn)向普惠算力基礎(chǔ)設(shè)施,為AI大規(guī)模產(chǎn)業(yè)化掃清成本障礙。返回搜狐,查看更多

羅福莉劃重點(diǎn),小米大模型降價(jià)99%的秘籍公開_MiMo-V_推理_Cache
全國(guó)服務(wù)熱線:
029-87375858

版權(quán)@|備案:粵IP*******|網(wǎng)站地圖
電話:15319955858   029-87375858咨詢微信:admin-2016
地址:西安市蓮湖區(qū)西大街宏府安定廣場(chǎng)4號(hào)樓581室
備案號(hào): 技術(shù)支持:模板星
公司專業(yè)從事青少年足球培訓(xùn),歡迎前來咨詢!

主站蜘蛛池模板: 成年人网站免费看 | 日韩a视频 | 在线观看韩国伦理 | 国产在线91精品 | 日韩午夜蜜桃久久 | 欧美干色 | 国产91视频在线 | 午夜福利视频无码 | 白丝自慰片 | 福利姬在线观看 | 欧洲午夜精品 | 国产高清hd | 中文在线欧美 | 在线影视院 | 国产中文字幕网 | 亚洲a成人| 成人精品无码 | 伦理电影在线 | 国产老女人网址 | 欧美va在线 | 夜夜撸小说一区 | 国产精品交换 | 国产精品宅男宅女 | 国产极品喷水视频 | 无码人妻在线播放 | 福利导航视频在线 | 在线国产视频99 | 欧美韩一区| 伊人网成人 | 牛牛色播 | 91视频日韩 | 国产美女福利在线 | 黄色网在线播放 | 成年人在线看视频 | AV天堂| 国产原创视频在线 | 超碰午夜羞羞片 | 97精品人人 | 成人天堂无码a | 新夜色福利帮网站 | 日韩美女诱惑 |