翻页 夜间
首页 > 兰戈 > 无间道三

天鹅套索

翼华科技贾淑芸: 在网络算力这一层,让每个Token更便宜_我的网站

无证之罪

A |     7月18日下午,由观察者网、WAIC CONNECT主办,半导体行业观察协办的“「重构算力」——AI算力需求与供给的结构性重构产业链接会”在上海张江科学会堂举办。    一根细丝织就匠心人生——走近丝筘金属制品有限公司织网工苑双龙8月20日,安平县丝筘金属制品有限公司生产车间,60余台智能编织机整齐排列,织针翻飞。作为WAIC 2026同期的一场重要产业活动,这场汇聚了政府、产业方与需求方的闭门研讨,把目光聚焦到AI算力供需两端的深层结构性变化。头戴防尘帽,织网工苑双龙迅速地将断丝接续,眼睛紧盯着编织机上细微的变化,直径极细的经纬线交织,一块网孔方正均匀、精细平整的丝网慢慢形成。

B | “这是700目的超细钨丝网,是国内最高目数的高端丝网,用于印刷光伏电池板,技术打破了国外垄断。         在主旨演讲嘉宾中,翼华科技(北京)股份有限公司联合创始人兼高级副总裁贾淑芸的分享格外引人关注。相较于场上被反复讨论的GPU、大模型与推理芯片,她所代表的DPU(数据处理单元)与智能网卡,是产业链条中一个更为“隐性”却越发关键的环节。”苑双龙一边调整织机参数一边介绍。         算力集群不是“堆卡”,是“组网”          “现代AIDC其实已经是一个巨型机系统。多年深耕一线,带头攻克“卡脖子”技术难题,推动丝网产业升级,前不久,38岁的苑双龙获得“省优秀共产党员”称号。苑双龙出生于安平县,身边的亲戚朋友都从事与丝网相关的工作。”贾淑芸在接受观察者网专访时着重强调了这一点。她把大型AI数据中心的问题归纳成三件事——“算、存、运”。小时候,听到“村里谁家的孩子当丝网工了”“谁家开了织网厂”,他都羡慕不已。为了改善生活,苑双龙上初中的时候,父母用省吃俭用攒下的4万元钱从二手交易市场买了一台织网机。         算,就是外界最为熟悉的GPU与推理芯片;存,对应显存、内存和闪存;而运,也就是通信,正是DPU与智能网卡所承担的部分。“当时别提多高兴了,虽然是台二手机器,那也意味着我们家也能编丝网赚钱了。         大模型训练与推理从来不是一张卡的独角戏,而是成千上万、甚至数十万张卡的集体作业。每完成一步计算,卡与卡之间就需要一次乃至多次数据交换。”苑双龙告诉记者。交换尚未完成,下一步就无法开工。平日里,父母织网的时候他就悄悄站在旁边,盯着穿丝、接扣的动作,默记在心。活儿多的时候,他索性也上手试一试,没想到织出来的丝网居然平整可用。也就是说,昂贵的算力在集群里有相当一部分时间其实是“在等网络”。“当时,安平大多是家庭作坊,大家主要织的是灰罗网,就几十目,精度要求不高,手艺也不算复杂,但能靠双手织出换钱的东西,觉得自己还挺厉害。         DPU与智能网卡真正做的事,是把网络协议处理、RDMA通信这些原本占用CPU、GPU的活承接过来,为计算核心提供一个稳定、可预测、可靠的通信接口;再把网络里的排队、丢包、重传抹平,不让任何一次尾部延时把整个集群拖入等待;同时把存储、安全等基础设施卸载下来,让大模型的记忆系统可以快速检索,不“失忆”。”苑双龙憨厚一笑。         一旦缺了这一层,后果对贾淑芸而言是显而易见的:GPU利用率上不去,万卡集群跑出五六千卡的有效算力,几乎等于把一半的采购成本打了水漂;集群规模越大越不稳定,一次长尾延时、一次网络抖动,就可能让整个训练任务中断回滚;CPU还会被网络和存储协议栈吃掉大量核数,整机成本进一步恶化。2006年5月,苑双龙应聘到安平县瑞申网业有限公司,成为一名真正的织网工。她给出的结论是,算力集群从来不是“堆卡”,而是“组网”——网络算力这一层,决定了买来的GPU算力最终能兑现多少。六台机器,十几个工人,三班倒着干。19岁的苑双龙跟在师傅门青杰身后,从最基础的接扣学起。

C | “编织机断丝了,得用手指把细丝搓接起来,接口必须平整,网面才能光滑。

D |          为什么是RISC-V          国内做DPU的公司不少,但大多数选择了ARM内核方案,翼华科技走的是自研RISC-V内核的路线,其首款基于自研RISC-V核的智能网卡已经流片并商用落地。

E | ”苑双龙回忆,师傅让他每天练一百个接扣,他的手指粗,搓比头发丝还细的网丝,根本没感觉,起初接的一半都不合格。这样一个相对独特的技术路径,背后是怎样的考量?          贾淑芸对观察者网阐述,成本、生态、供应链安全,都在权衡范围之内,但最根本的原因是DPU这个品类与RISC-V的技术特性天然契合。那段时间,只要有空他就捏着丝线找手感,两个指肚因为长时间摩擦起了水泡,长出了厚厚的茧子。她解释,DPU本质上是一颗领域专用处理器,核心任务是报文处理与存储、计算卸载,追求的是高带宽、低时延与能效比,而不是通用计算意义上的大而全。RISC-V最大的优势就在于指令集可以灵活扩展——针对网络报文处理、KV管理加速去定制指令与微架构,尤其是矢量扩展(Vector Extension)非常适合数据面与检索类工作,这在标准ARM核授权模式下很难做到。4个月后,再次考核检验时,苑双龙接的扣合格率100%,达到了“紧、光、直”的高标准要求。         翼华自研的RISC-V核支持RVA23规范,具备多发射、乱序执行、浮点与矢量计算能力;SoC层面则采用了灵活的集群架构,CPU核与自研的网络、安全加速引擎通过高带宽总线紧耦合,能够按客户对性能、功耗、面积的不同要求灵活配置。凭着这股韧劲,他提前两个月转为正式工。2023年,光伏行业产能持续扩张。对于外界关心的生态短板,她也做了分析——相比x86和ARM,RISC-V生态确实还有差距,但对DPU来说“够用了”:GCC、LLVM工具链、Linux操作系统、DPDK等网络开源软件的支持都已经比较成熟,翼华本身也在通过开源方式反哺RISC-V在网络和存储方向的生态。         这条路径对翼华的竞争力意味着什么?意味着性能优化的天花板从此掌握在自己手里;产品定义摆脱了指令集授权的约束,可以跟随客户需求快速迭代;从指令集到核到SoC的全链路自主可控,在当前的产业环境下,对客户而言更是实实在在的价值。嗅到商机,瑞申网业总经理刘彦辉成立丝筘金属制品有限公司,决心研发应用于光伏电池板的480目、11微米的高目数不锈钢印刷网。“以前这种产品完全依赖进口,我们也从来没有接触过这么细的丝,手上有个不起眼的皮,都能把丝挂断。

F | ”刘彦辉说,一平方英寸网面上纵横交织着20多万个网孔,每个孔径误差要小于3%、网面厚度小于0.5微米,编织难度非常大。接下这个任务,苑双龙感到前所未有的压力。首款RISC-V智能网卡的流片与商用,也验证了这条路线走得通。         从“省”到“快”:图南系列的AI适配          DPU最初是云厂商的故事,主要解决虚拟化卸载、多租户隔离这类问题。但当AI大模型训练成为主角,网络吞吐与时延的要求较之传统云计算已经高出好几个量级。白天上机,晚上翻资料,平均一天操作上百次,实在累得不行,他就在车间打个盹儿,醒来后继续在机床上练。这样的需求切换,如何反过来定义DPU的产品设计与商业模式?          贾淑芸的判断是“根本性的”变化。她把云时代DPU的核心命题概括为一个字——“省”,把虚拟化、多租户隔离、存储协议这些开销从CPU上卸下来,帮云厂商省出可以对外销售的CPU核数;而AI时代DPU的核心命题则换成了“快”,训练集群对RDMA吞吐、时延和抖动的要求高出数个量级,网络性能直接决定了GPU利用率,也直接决定了每一次训练任务的成本与成败。         这种变化传导到产品与商业两个层面。去年3月,他们终于研发出480目、11微米的不锈钢印刷网,并开始批量生产。今年年初,苑双龙又牵头攻下700目超细钨丝网。产品设计上,重心从控制面卸载转向数据面性能:RDMA引擎要自研,拥塞控制算法要深度优化,大规模组网下的低时延低抖动要有保障,还要和调度系统、集合通信库紧密协同。长期的机台磨炼,苑双龙还练出了诊断织机故障的绝活。有一次,织机“哐当”响过后,纬线突然回缩,网面瞬间皱成一团废品。商业模式上,客户也从头部云厂商的定制项目扩展到智算中心、服务器整机厂和行业客户,产品的标准化和兼容性要求随之提高,国产化替代成为一个明确的增量市场。门青杰先后喊来几个织网工,个个摇头。         翼华科技的“图南”系列智能网卡,正是按照这一逻辑打造的。它基于翼华拥有自主知识产权的芯片架构实现高吞吐线速转发,配合自研的RDMA技术面向智算场景大规模组网做优化,同时保留P4可编程能力,让网络、存储、安全、运维等各类负载都可以灵活卸载,既满足AI训练推理对高性能网络的严苛要求,也能覆盖云数据中心与边缘计算的传统场景。RISC-V的通用处理能力则被用来实现流量的管理和调度。

G | 正在轮休的苑双龙被叫了回来,他围着机器转了三圈,蹲下身,盯着边丝轴,手指捻了捻那根细丝。

H | “症结在这儿,边丝太细,张力扛不住。”苑双龙转身翻出几个空轴,跑到打丝机前,现打了几轴粗些的边丝,利索地换上。

I |          在此基础上,翼华还计划推出“培风图南”系列AI-DPU。重启后,织机“吐”出平整网面,工友们兴奋地为他鼓掌叫好。借助RISC-V的通用处理能力与RVV向量处理能力,这条产品线将进一步实现KV Cache管理的卸载与加速,构建大模型的"记忆层",降低推理应用的部署成本,同时提升推理速度。编织中最常见的断丝问题,他也琢磨出了门道——用细砂纸打磨综片,综片光滑了,丝自然就不易断了。“双龙脑子活,肯琢磨,别人想不到的他都能想到,是公司技术最精湛的织网工。”刘彦辉评价。二十年来,苑双龙检修机器130余次,为企业节约维修成本330多万元,他编织的不锈钢印刷网超12万平方米,创收近5000万元,产品品质达国内顶尖水平。         客户到底为什么买单          英伟达BlueField系列早已大规模部署,国内DPU赛道这几年也涌现出不少创业公司。他也逐渐成长为技术能手,先后获得省劳动模范、全国五一劳动奖章等荣誉。翼华的图南系列既然已经商用,主要落地在哪些客户手中?          贾淑芸介绍,图南系列SuperNIC目前的客户可以分成几类:智算中心的建设方与运营方,用它做GPU集群的高性能参数面与存储面网络;服务器整机厂商,把智能网卡作为整机方案的标准部件;云和边缘计算客户,用于虚拟化卸载和5G边缘业务加速;此外在运营商与部分行业客户侧也有项目在推进。“公司还要开发更高目数的印刷网,我一定全力以赴,让安平丝网走向更广阔的市场。而计划推出的培风图南系列,则将主要面向大模型应用公司和Token工厂运营方,通过构建大模型记忆层降低推理部署成本、同时提升长程任务的推理性能。         至于客户在选择国产DPU时最看重什么,她的答案与外界的直觉不太一样:稳定性和兼容性排在第一位,价格反而排在最后。”苑双龙说。原因并不难理解——网卡是7×24小时在线的部件,客户不会为了追求部分性能特性而牺牲可用性,能否平滑接入现有的服务器、交换机与软件栈,是商用的前提;其次才是性能,尤其是RDMA场景下的真实表现。“客户算的是总账,一张卡如果能把GPU利用率提上来几个点,卡本身的价差可以忽略不计。(日报记者 王璐丹)。”贾淑芸表示,翼华的策略一直是把稳定性和兼容性做扎实,再谈性能领先。         行业洗牌中的生存法则          2021年、2022年,DPU一度是资本追捧的风口,大量创业公司涌入。此后两年,赛道明显进入收缩与整合期。

J | 作为一家2022年成立的公司,翼华科技如何看待这一轮洗牌?          贾淑芸对那段热潮做了深入剖析。认为其中确实有泡沫的成分——资本看到了BlueField的故事,团队蜂拥而入,但很多公司低估了两件事:一方面,芯片的产业周期是硬约束,从流片到商用再到规模上量,没有三五年下不来,烧钱速度远超预期;另一方面,DPU并不是一颗芯片的生意,而是一整套软硬件生态的生意,驱动、协议栈以及与客户环境的适配工作,工程量甚至比芯片本身还要大。这两年资本退潮、行业整合,本质上是回归常识。         翼华成立于2022年,恰好赶上热潮的尾巴与寒冬的开头。这样的时点,反而倒逼团队从第一天起就保持克制——不追求大而全的产品定义,聚焦智算这个真实需求场景;控制团队规模与研发节奏,把资金花在流片和客户落地上。她提到,2022年也正好是面向GPU互联的SuperNIC元年,翼华科技从起步阶段就锁定了SuperNIC与AI-DPU这两大潜力市场。         而在她给出的DPU公司生存清单里,有几点尤为关键:芯片要真正流片、真正商用,而不是停留在PPT和FPGA原型阶段;要有付费客户、有可复制的场景,形成正向的收入循环;还要在英伟达和头部云厂商自研之外,找到自己不可替代的差异化位置——比如翼华科技选择的RISC-V自研路线,以及为大模型构建记忆层的AI-DPU路径。

K | 行业洗牌未必是坏事,泡沫出清之后,留下来的公司会拿到更集中的资源和更清晰的市场。         国产智算的网络答卷          产业最关切的宏观议题之一是国产智算能否实现真正的全栈自主。今天的智算中心,机内互联主要依赖NVLink,机间互联依赖InfiniBand,本质上仍是英伟达的封闭生态。         在贾淑芸看来,这是最关键也最难攻克的一层。国产GPU单卡性能还在追赶,但如果互联问题不解决,卡越多、集群效率损失越大,“全栈自主”就只能是一句空话。她给出的方向是开放的以太网路线——用增强以太网加RDMA去对标乃至超越InfiniBand。

L | 这也是全球产业的共识方向,超以太网(Ultra Ethernet)等新标准的演进,本质上都是要用开放生态对抗封闭体系。         要走通这条路,必须有三个层面的支撑:高性能的国产网卡与DPU芯片,把RDMA、拥塞控制这些核心能力真正做到自主;国产交换机与国产GPU的端网协同,一张好网卡还不够,整个链路要一起调优;开放的标准和软件生态,让智算中心不被任何单一厂商锁定。         翼华科技的产品与生态布局,也是沿着这三条线在推进。产品上,图南系列将加速向更高带宽演进,持续强化面向智算场景的自研协议处理引擎和拥塞控制能力;生态上,翼华正与国产GPU厂商、服务器厂商、交换机厂商推进深度的端网适配和联合方案;同时通过开源P4处理器和自研的虚拟协议处理器,提供快速适配开放协议的能力,反哺网络标准和协议组织——凭借可编程的方法,翼华SuperNIC可以同时支持RoCE、UEC乃至各家的自定义协议。         “我们的目标很明确:在国产智算的网络算力这一层,做出真正可规模商用的自主选择。

M | ”贾淑芸这样总结。         回到WAIC「重构算力」的现场议程——训练推理转型、国产算力生态、HBM/CPO先进硬件、万卡集群调度、智算新基建全链路成本测算,几乎每一个议题都指向同一个命题:算力供需之间的结构性重构。而在这场重构里,DPU与智能网卡所代表的“网络算力”环节,正是决定国产AI基础设施上限的关键变量之一。翼华科技所代表的自研RISC-V DPU路线,能否在这一轮洗牌之后跑出属于中国的BlueField,将是产业界接下来数年最值得关注的看点之一。         本文系观察者网独家稿件,未经授权,不得转载。

N |

Current article:http://rfw91eo.linlangdouwaqiexusan.bond/list_vo22ey/xt5uvzq.xls

Published on:15:41:12