午夜神马影院-日本天堂在线-国产精品777-奇米影视亚洲春色-天堂8中文-日本在线观看一区二区-天天干天天操天天插-国产精品女同-色骚综合-四川一级毛毛片-99在线看-国产极品久久-波多野吉衣毛片-婷婷在线综合-欧美视频成人-亚洲影视一区二区三区-国产精品久久久久久久一区二区-国产精品9191-污污免费观看-日本三区在线

逛完WAIC才明白,國(guó)產(chǎn)算力不跟英偉達(dá)比單卡了

逛完WAIC才明白,國(guó)產(chǎn)算力不跟英偉達(dá)比單卡了

Napoleon Chan / 2026-07-21 09:3850758
標(biāo)簽:WAIC2026

據(jù)SemiAnalysis測(cè)算,單顆國(guó)產(chǎn)AI芯片的性能,大約是英偉達(dá)Blackwell架構(gòu)的三分之一。

這是國(guó)產(chǎn)算力在先進(jìn)制程受限下面對(duì)的物理天花板。但在WAIC2026上,一條繞開(kāi)這塊天花板的路線被跑通。當(dāng)芯算融合館擠滿專業(yè)觀眾時(shí),很多人是來(lái)看這套新解法的。

IMG_8973.HEIC.JPG

“拼積木”的系統(tǒng)戰(zhàn)

既然單卡存在差距,那就把卡連起來(lái)。這種把幾百上千顆芯片組合成一臺(tái)“超級(jí)計(jì)算機(jī)”的技術(shù),業(yè)內(nèi)叫超節(jié)點(diǎn)。

華為之前算過(guò)一筆賬。單顆昇騰芯片確實(shí)有差距,可一旦用高速互聯(lián)技術(shù)把它們組成CloudMatrix 384集群,總體性能是英偉達(dá)GB200 NVL72的1.7倍,內(nèi)存容量達(dá)到3.6倍。這種方案彌補(bǔ)了單點(diǎn)性能短板,在整體吞吐量上實(shí)現(xiàn)了反超。

這次在WAIC現(xiàn)場(chǎng),華為把Atlas 950超節(jié)點(diǎn)真機(jī)拉了過(guò)來(lái)。這個(gè)龐然大物單機(jī)柜裝了64張卡,靠著自研的靈衢協(xié)議,能把1024張卡連在一起。它實(shí)現(xiàn)了256TB的全局統(tǒng)一內(nèi)存編址。大模型訓(xùn)練中芯片之間數(shù)據(jù)交互頻繁,現(xiàn)在所有芯片訪問(wèn)遠(yuǎn)端數(shù)據(jù)就像訪問(wèn)本地緩存一樣快,通信時(shí)延壓到了3微秒。昇騰上一代超節(jié)點(diǎn)已在20多個(gè)行業(yè)落地750多套,這種從技術(shù)可行到商業(yè)可用的跨越,給行業(yè)留下了實(shí)際的參考樣本。

image1.jpeg

 不只是華為在做這件事。中科曙光宣布了國(guó)內(nèi)首個(gè)全國(guó)產(chǎn)十萬(wàn)卡AI超集群“曙光8000”投入使用。這套系統(tǒng)以海光芯片為算力底座,采用“超智融合”技術(shù)路線,同時(shí)支持高精度科學(xué)計(jì)算和低精度智能計(jì)算。十萬(wàn)張卡的規(guī)模,對(duì)系統(tǒng)可靠性要求極高,任何一個(gè)部件抖動(dòng)都可能導(dǎo)致整體作廢。中科曙光給出的解法,是算力單元與機(jī)柜解耦,單節(jié)點(diǎn)集成40張GPU,部署周期從數(shù)月縮短到了數(shù)小時(shí)。

image2.jpeg

中興通訊在展會(huì)上發(fā)布了OEX超節(jié)點(diǎn)。他們的思路是開(kāi)放解耦,底層協(xié)議標(biāo)準(zhǔn)化,全面兼容壁仞、沐曦、燧原等國(guó)內(nèi)多元GPU生態(tài)。客戶可以自主選擇最優(yōu)的芯片組合,再通過(guò)中興的大容量交換芯片打通機(jī)內(nèi)與機(jī)間互聯(lián)。為了解決散熱問(wèn)題,這套方案配套了全棧液冷技術(shù),能把PUE控制在1.15以內(nèi)。

image3.jpeg

清微智能也在展示他們的REX81 Supernode系統(tǒng)。這套系統(tǒng)集成了4096顆TX81芯片,算力突破每秒500千萬(wàn)億次。清微智能CTO歐陽(yáng)鵬的解釋很直白:超節(jié)點(diǎn)就是把眾多芯片緊耦合在一起,像一個(gè)單一節(jié)點(diǎn)一樣工作。通過(guò)芯片直連通道,這套方案減少了傳統(tǒng)集群中的交換節(jié)點(diǎn),互聯(lián)成本降幅約90%。

image4.png

超節(jié)點(diǎn)扎堆出現(xiàn),不是巧合。大家等于承認(rèn)了一件事:制程上那點(diǎn)差距,短期追不上,那就換個(gè)地方比。

被低估的生態(tài)軟板

行業(yè)里衡量這件事有個(gè)硬指標(biāo),叫MFU,模型算力利用率。芯片標(biāo)稱算力再高,真正能用在訓(xùn)練上的只是一部分。有科技公司基礎(chǔ)設(shè)施負(fù)責(zé)人算過(guò)一筆賬,極端情況下,模型訓(xùn)練過(guò)程中會(huì)浪費(fèi)掉一半算力。而決定這個(gè)指標(biāo)高低的,很大程度上不是芯片本身,是底層驅(qū)動(dòng)、算子庫(kù)和并行策略這些軟件層的功夫。

國(guó)產(chǎn)陣營(yíng)在這上面已經(jīng)交出過(guò)一份答卷。華為用8192枚昇騰910訓(xùn)練盤(pán)古大模型時(shí),MFU超過(guò)了50%,而訓(xùn)練同類稠密模型的業(yè)內(nèi)普遍基準(zhǔn)通常在40%到50%之間。但單點(diǎn)案例不等于普遍水平。CUDA生態(tài)覆蓋了絕大多數(shù)開(kāi)發(fā)者,開(kāi)發(fā)者設(shè)計(jì)新算子,第一時(shí)間適配的還是英偉達(dá)的卡。如果國(guó)產(chǎn)軟件棧跟不上主流開(kāi)源框架的更新節(jié)奏,客戶手里的卡就跑不起來(lái)新模型。

image5.jpeg

所以今年WAIC上,算力廠商開(kāi)始在軟件適配上發(fā)力。清微智能的RAISA軟件棧已經(jīng)適配了200多個(gè)大模型,支持PyTorch等主流框架和CUDA算子遷移。華為的昇騰CANN也在全面開(kāi)源開(kāi)放,旨在降低開(kāi)發(fā)者的遷移門(mén)檻。沐曦股份帶著全精度GPGPU架構(gòu)和MXMACA軟件棧亮相,嘗試建立完整的軟件生態(tài)。

芯片發(fā)布只是第一步,讓開(kāi)發(fā)者用得順手,才是決定產(chǎn)品能否存活的關(guān)鍵。

推理時(shí)代的門(mén)票

算力基礎(chǔ)設(shè)施的這波重構(gòu),背后是一本經(jīng)濟(jì)賬。

IDC中國(guó)上個(gè)月表示,到2027年,推理會(huì)占到智能算力需求的七成以上。這個(gè)數(shù)字意味著什么?前幾年買(mǎi)卡主要是為了訓(xùn)模型,訓(xùn)完一輪算一輪。推理不一樣,模型只訓(xùn)幾次,推理卻要發(fā)生億萬(wàn)次,智能體一個(gè)任務(wù)還會(huì)連續(xù)觸發(fā)好幾輪模型調(diào)用。到了這一步,客戶關(guān)心的就不再是峰值算力,而是并發(fā)撐不撐得住、響應(yīng)快不快、每個(gè)Token的成本能不能壓下來(lái)。

image6.jpeg

而推理恰恰最吃通信時(shí)延和互聯(lián)帶寬,這兩樣都是超節(jié)點(diǎn)的長(zhǎng)處。賣方市場(chǎng)已經(jīng)有了反應(yīng)。華泰證券在研報(bào)中,把超節(jié)點(diǎn)稱作“26年國(guó)產(chǎn)算力破局之道”,測(cè)算出的2028年市場(chǎng)規(guī)模是3414億元。訂單也來(lái)得比預(yù)想的快。中國(guó)移動(dòng)今年3月啟動(dòng)了集團(tuán)層面首次AI超節(jié)點(diǎn)集采,6208張加速卡,運(yùn)營(yíng)商里這是頭一回。

采購(gòu)方的口味也跟著變了。前幾年客戶拿著單卡參數(shù)表挑貨,現(xiàn)在直接問(wèn):能不能把我的模型跑起來(lái),后續(xù)擴(kuò)容怎么辦。這道題單靠芯片答不了,互聯(lián)協(xié)議、整機(jī)柜、散熱、軟件棧,哪一環(huán)短了都交不出貨。逛完這屆WAIC再回頭看,單顆芯片三分之一的差距還在那里,但行業(yè)已經(jīng)不在這個(gè)刻度上糾纏了。勝負(fù)手換成了另一個(gè):誰(shuí)能把一整套系統(tǒng)穩(wěn)定地交到客戶機(jī)房里。

聲明類型:無(wú)需添加自主聲明

發(fā)表評(píng)論注冊(cè)|