天數智芯WAIC發布天垓300,國產GPU開始比拼實際效率
今年逛WAIC,有一個變化挺明顯。聊算力的人依然很多,但大家討論的重點已經和前兩年不太一樣了。過去更多是在比芯片參數、比峰值算力,今年不少廠商都開始強調模型真正跑起來之后的效率,比如訓練速度、推理響應、多卡通信,以及軟件生態和整體部署成本。
天數智芯這次發布天垓300,關注點也放在了這里。相比單純提升算力指標,它更強調Attention、MoE、Agent推理等真實應用場景的優化,希望把底層算力更高效地轉化為實際業務能力。

天數智芯AI與加速計算負責人單天逸將AI的發展劃分為三個階段:處理和生成內容的“信息智能”、能夠規劃并執行任務的“行動智能”,以及面向科學發現和未知探索的“探索智能”。在他看來,不同階段對應著不同的計算需求,這也成為天垓300此次產品設計的核心思路。
針對目前應用最廣泛的大模型場景,天垓300重點優化了Attention和MoE兩項核心計算負載。大模型參數越做越大,上下文窗口越拉越長,Attention運算已經成為整個訓練和推理流程中最吃性能的環節。天數智芯公布的數據顯示,天垓300在不同精度下的Attention計算效率都超過了90%;在64K長上下文的測試場景里,整體效能比Hopper架構的主流方案高出大約10%。
MoE(混合專家模型)同樣是當前主流大模型的重要方向。為了減少專家調度和數據路由帶來的性能損耗,天垓300針對算法和硬件進行了協同優化。官方數據顯示,在DeepSeek V4 MoE場景下,產品計算效率超過了70%,推理階段也能夠在保持響應體驗的同時支持更多并發請求。
除了訓練,大模型推理也是此次升級的重點。尤其是Agent興起之后,模型不僅需要理解用戶需求,還要不斷調用工具、規劃流程并完成執行,這也對首字響應速度、多卡通信以及整體時延提出了更高要求。
針對這一變化,天垓300分別對Prefill和Decode兩個階段也進行了優化。按照官方公布的數據,在Qwen、GLM、Kimi、DeepSeek等主流模型測試中,產品首字延遲相比Hopper方案降低約20%;針對Decode階段頻繁的小數據通信,平均通信延遲降低約13%。這些優化最終對應的是智能編程、辦公助手、企業自動化等Agent應用更快的響應體驗。
除了生成式AI,天數智芯此次也把重點放到了未來可能快速增長的探索智能領域,包括世界模型、新材料研發、數字孿生、氣象預測等科學計算場景。

不同于只針對Transformer進行優化的設計思路,天垓300采用SIMT通用計算架構,可支持標量、矢量和張量等多種計算類型,同時覆蓋FP4、FP8等多種計算精度,并支持矩陣求解、動態規劃、稀疏計算等不同計算任務。官方介紹,在Cosmos3世界模型測試中,天垓300推理效能同樣較Hopper架構主流方案提升約10%。
據天數智芯介紹,公司自2018年以來一直在完善軟件生態,目前已開發近百個加速庫,并支持主流AI框架、模型及關鍵加速組件。天垓300也已經與國內云廠商、服務器廠商等展開適配,可支持從單機到萬卡集群部署,進一步降低企業部署和遷移成本。天數智芯此次帶來的天垓300,并沒有只圍繞某一項性能指標做優化,而是把重點放在大模型訓練、Agent推理以及科學計算等不同應用場景。從現場介紹來看,這款產品希望覆蓋的不只是當下的大模型應用,也希望為未來更多AI計算需求做好準備。

在熱點科技看來,今年WAIC釋放出一個比較明顯的信號:國產GPU的競爭重點正在發生變化。過去行業更多討論芯片參數和峰值性能,而隨著大模型、Agent不斷進入實際應用,企業開始更加關注訓練效率、推理體驗、軟件生態以及整體部署成本。
天數智芯WAIC發布天垓300,國產GPU開始比拼實際效率
Amelia














滬公網安備 31010702005758號
發表評論注冊|登錄