翼华科技贾淑芸: 在网络算力这一层,让每个Token更便宜

小新 正三品 (侍郎) 2026-07-20 08:08 6 0 返回 新闻时事
小新 正三品 (侍郎) 楼主
2026-07-20 08:08
第1楼

AI摘要:7月18日下午,由观察者网、WAIC CONNECT主办,半导体行业观察协办的“「重构算力」——AI算力需求与供给的结构性重构产业链接会”在上海张江科学会堂举办。她把大型AI数据中心的问题归纳成三件事——“算、存、运”。DPU与智能网卡真正做的事,是把网络协议处理、RDMA通信这些原本占用CPU、GPU的活承接过来,为计算核心提供一个稳定、可预测、可靠的通信接口;再把网络里的排队、丢包、重传抹平,不让任何一次尾部延时把整个集群拖入等待;同时把存储、安全等基础设施卸载下来,让大模型的记忆系统可以快速检索,不“失忆”。


7月18日下午,由观察者网、WAIC CONNECT主办,半导体行业观察协办的“「重构算力」——AI算力需求与供给的结构性重构产业链接会”在上海张江科学会堂举办。作为WAIC 2026同期的一场重要产业活动,这场汇聚了政府、产业方与需求方的闭门研讨,把目光聚焦到AI算力供需两端的深层结构性变化。

在主旨演讲嘉宾中,翼华科技(北京)股份有限公司联合创始人兼高级副总裁贾淑芸的分享格外引人关注。相较于场上被反复讨论的GPU、大模型与推理芯片,她所代表的DPU(数据处理单元)与智能网卡,是产业链条中一个更为“隐性”却越发关键的环节。

算力集群不是“堆卡”,是“组网”

“现代AIDC其实已经是一个巨型机系统。”贾淑芸在接受观察者网专访时着重强调了这一点。她把大型AI数据中心的问题归纳成三件事——“算、存、运”。

算,就是外界最为熟悉的GPU与推理芯片;存,对应显存、内存和闪存;而运,也就是通信,正是DPU与智能网卡所承担的部分。

大模型训练与推理从来不是一张卡的独角戏,而是成千上万、甚至数十万张卡的集体作业。每完成一步计算,卡与卡之间就需要一次乃至多次数据交换。交换尚未完成,下一步就无法开工。也就是说,昂贵的算力在集群里有相当一部分时间其实是“在等网络”。

DPU与智能网卡真正做的事,是把网络协议处理、RDMA通信这些原本占用CPU、GPU的活承接过来,为计算核心提供一个稳定、可预测、可靠的通信接口;再把网络里的排队、丢包、重传抹平,不让任何一次尾部延时把整个集群拖入等待;同时把存储、安全等基础设施卸载下来,让大模型的记忆系统可以快速检索,不“失忆”。

一旦缺了这一层,后果对贾淑芸而言是显而易见的:GPU利用率上不去,万卡集群跑出五六千卡的有效算力,几乎等于把一半的采购成本打了水漂;集群规模越大越不稳定,一次长尾延时、一次网络抖动,就可能让整个训练任务中断回滚;CPU还会被网络和存储协议栈吃掉大量核数,整机成本进一步恶化。她给出的结论是,算力集群从来不是“堆卡”,而是“组网”——网络算力这一层,决定了买来的GPU算力最终能兑现多少。

为什么是RISC-V

国内做DPU的公司不少,但大多数选择了ARM内核方案,翼华科技走的是自研RISC-V内核的路线,其首款基于自研RISC-V核的智能网卡已经流片并商用落地。这样一个相对独特的技术路径,背后是怎样的考量?

贾淑芸对观察者网阐述,成本、生态、供应链安全,都在权衡范围之内,但最根本的原因是DPU这个品类与RISC-V的技术特性天然契合。她解释,DPU本质上是一颗领域专用处理器,核心任务是报文处理与存储、计算卸载,追求的是高带宽、低时延与能效比,而不是通用计算意义上的大而全。RISC-V最大的优势就在于指令集可以灵活扩展——针对网络报文处理、KV管理加速去定制指令与微架构,尤其是矢量扩展(Vector Extension)非常适合数据面与检索类工作,这在标准ARM核授权模式下很难做到。

翼华自研的RISC-V核支持RVA23规范,具备多发射、乱序执行、浮点与矢量计算能力;SoC层面则采用了灵活的集群架构,CPU核与自研的网络、安全加速引擎通过高带宽总线紧耦合,能够按客户对性能、功耗、面积的不同要求灵活配置。对于外界关心的生态短板,她也做了分析——相比x86和ARM,RISC-V生态确实还有差距,但对DPU来说“够用了”:GCC、LLVM工具链、Linux操作系统、DPDK等网络开源软件的支持都已经比较成熟,翼华本身也在通过开源方式反哺RISC-V在网络和存储方向的生态。

这条路径对翼华的竞争力意味着什么?意味着性能优化的天花板从此掌握在自己手里;产品定义摆脱了指令集授权的约束,可以跟随客户需求快速迭代;从指令集到核到SoC的全链路自主可控,在当前的产业环境下,对客户而言更是实实在在的价值。首款RISC-V智能网卡的流片与商用,也验证了这条路线走得通。

从“省”到“快”:图南系列的AI适配

DPU最初是云厂商的故事,主要解决虚拟化卸载、多租户隔离这类问题。但当AI大模型训练成为主角,网络吞吐与时延的要求较之传统云计算已经高出好几个量级。这样的需求切换,如何反过来定义DPU的产品设计与商业模式?

贾淑芸的判断是“根本性的”变化。她把云时代DPU的核心命题概括为一个字——“省”,把虚拟化、多租户隔离、存储协议这些开销从CPU上卸下来,帮云厂商省出可以对外销售的CPU核数;而AI时代DPU的核心命题则换成了“快”,训练集群对RDMA吞吐、时延和抖动的要求高出数个量级,网络性能直接决定了GPU利用率,也直接决定了每一次训练任务的成本与成败。

这种变化传导到产品与商业两个层面。产品设计上,重心从控制面卸载转向数据面性能:RDMA引擎要自研,拥塞控制算法要深度优化,大规模组网下的低时延低抖动要有保障,还要和调度系统、集合通信库紧密协同。商业模式上,客户也从头部云厂商的定制项目扩展到智算中心、服务器整机厂和行业客户,产品的标准化和兼容性要求随之提高,国产化替代成为一个明确的增量市场。

翼华科技的“图南”系列智能网卡,正是按照这一逻辑打造的。它基于翼华拥有自主知识产权的芯片架构实现高吞吐线速转发,配合自研的RDMA技术面向智算场景大规模组网做优化,同时保留P4可编程能力,让网络、存储、安全、运维等各类负载都可以灵活卸载,既满足AI训练推理对高性能网络的严苛要求,也能覆盖云数据中心与边缘计算的传统场景。RISC-V的通用处理能力则被用来实现流量的管理和调度。

在此基础上,翼华还计划推出“培风图南”系列AI-DPU。借助RISC-V的通用处理能力与RVV向量处理能力,这条产品线将进一步实现KV Cache管理的卸载与加速,构建大模型的"记忆层",降低推理应用的部署成本,同时提升推理速度。

客户到底为什么买单

英伟达BlueField系列早已大规模部署,国内DPU赛道这几年也涌现出不少创业公司。翼华的图南系列既然已经商用,主要落地在哪些客户手中?

贾淑芸介绍,图南系列SuperNIC目前的客户可以分成几类:智算中心的建设方与运营方,用它做GPU集群的高性能参数面与存储面网络;服务器整机厂商,把智能网卡作为整机方案的标准部件;云和边缘计算客户,用于虚拟化卸载和5G边缘业务加速;此外在运营商与部分行业客户侧也有项目在推进。而计划推出的培风图南系列,则将主要面向大模型应用公司和Token工厂运营方,通过构建大模型记忆层降低推理部署成本、同时提升长程任务的推理性能。

至于客户在选择国产DPU时最看重什么,她的答案与外界的直觉不太一样:稳定性和兼容性排在第一位,价格反而排在最后。原因并不难理解——网卡是7×24小时在线的部件,客户不会为了追求部分性能特性而牺牲可用性,能否平滑接入现有的服务器、交换机与软件栈,是商用的前提;其次才是性能,尤其是RDMA场景下的真实表现。“客户算的是总账,一张卡如果能把GPU利用率提上来几个点,卡本身的价差可以忽略不计。”贾淑芸表示,翼华的策略一直是把稳定性和兼容性做扎实,再谈性能领先。

行业洗牌中的生存法则

2021年、2022年,DPU一度是资本追捧的风口,大量创业公司涌入。此后两年,赛道明显进入收缩与整合期。作为一家2022年成立的公司,翼华科技如何看待这一轮洗牌?

贾淑芸对那段热潮做了深入剖析。认为其中确实有泡沫的成分——资本看到了BlueField的故事,团队蜂拥而入,但很多公司低估了两件事:一方面,芯片的产业周期是硬约束,从流片到商用再到规模上量,没有三五年下不来,烧钱速度远超预期;另一方面,DPU并不是一颗芯片的生意,而是一整套软硬件生态的生意,驱动、协议栈以及与客户环境的适配工作,工程量甚至比芯片本身还要大。这两年资本退潮、行业整合,本质上是回归常识。

翼华成立于2022年,恰好赶上热潮的尾巴与寒冬的开头。这样的时点,反而倒逼团队从第一天起就保持克制——不追求大而全的产品定义,聚焦智算这个真实需求场景;控制团队规模与研发节奏,把资金花在流片和客户落地上。她提到,2022年也正好是面向GPU互联的SuperNIC元年,翼华科技从起步阶段就锁定了SuperNIC与AI-DPU这两大潜力市场。

而在她给出的DPU公司生存清单里,有几点尤为关键:芯片要真正流片、真正商用,而不是停留在PPT和FPGA原型阶段;要有付费客户、有可复制的场景,形成正向的收入循环;还要在英伟达和头部云厂商自研之外,找到自己不可替代的差异化位置——比如翼华科技选择的RISC-V自研路线,以及为大模型构建记忆层的AI-DPU路径。行业洗牌未必是坏事,泡沫出清之后,留下来的公司会拿到更集中的资源和更清晰的市场。

国产智算的网络答卷

产业最关切的宏观议题之一是国产智算能否实现真正的全栈自主。今天的智算中心,机内互联主要依赖NVLink,机间互联依赖InfiniBand,本质上仍是英伟达的封闭生态。

在贾淑芸看来,这是最关键也最难攻克的一层。国产GPU单卡性能还在追赶,但如果互联问题不解决,卡越多、集群效率损失越大,“全栈自主”就只能是一句空话。她给出的方向是开放的以太网路线——用增强以太网加RDMA去对标乃至超越InfiniBand。这也是全球产业的共识方向,超以太网(Ultra Ethernet)等新标准的演进,本质上都是要用开放生态对抗封闭体系。

要走通这条路,必须有三个层面的支撑:高性能的国产网卡与DPU芯片,把RDMA、拥塞控制这些核心能力真正做到自主;国产交换机与国产GPU的端网协同,一张好网卡还不够,整个链路要一起调优;开放的标准和软件生态,让智算中心不被任何单一厂商锁定。

翼华科技的产品与生态布局,也是沿着这三条线在推进。产品上,图南系列将加速向更高带宽演进,持续强化面向智算场景的自研协议处理引擎和拥塞控制能力;生态上,翼华正与国产GPU厂商、服务器厂商、交换机厂商推进深度的端网适配和联合方案;同时通过开源P4处理器和自研的虚拟协议处理器,提供快速适配开放协议的能力,反哺网络标准和协议组织——凭借可编程的方法,翼华SuperNIC可以同时支持RoCE、UEC乃至各家的自定义协议。

“我们的目标很明确:在国产智算的网络算力这一层,做出真正可规模商用的自主选择。”贾淑芸这样总结。

回到WAIC「重构算力」的现场议程——训练推理转型、国产算力生态、HBM/CPO先进硬件、万卡集群调度、智算新基建全链路成本测算,几乎每一个议题都指向同一个命题:算力供需之间的结构性重构。而在这场重构里,DPU与智能网卡所代表的“网络算力”环节,正是决定国产AI基础设施上限的关键变量之一。翼华科技所代表的自研RISC-V DPU路线,能否在这一轮洗牌之后跑出属于中国的BlueField,将是产业界接下来数年最值得关注的看点之一。

本文系观察者网独家稿件,未经授权,不得转载。

暂无回复,快来抢沙发吧!

  • 1 / 1 页
敬请注意:文中内容观点和各种评论不代表本网立场!若有违规侵权,请联系我们