首页 - 股票 - 证券要闻 - 正文

中科曙光发布Token加速技术体系

(原标题:中科曙光发布Token加速技术体系)

近日,中科曙光发布scaleFabric Token加速技术体系。该体系以scaleFabric原生无损RDMA(远程直接内存访问)高速网络为核心,通过计算、存储与网络协同,减少数据传输和读取过程中的等待,提升大模型运行效率。其中,支持GPU直接发起网络通信的IBGDA技术,已在十万卡级集群中完成验证,实现国内首次规模化落地。

Token(词元)是大模型处理和输出内容的基本单位,其生成效率直接影响模型响应速度与服务能力。“Token是当前AI工厂最重要的产出,也是衡量AI效能和经济效益的重要指标。”中科曙光高性能计算产品事业部总工程师万伟表示,分布式架构下,Token相关数据需要在不同GPU之间频繁传递,数据流转的快慢会直接影响整个集群的计算效率。

这种影响在训练和推理两个阶段体现得尤为明显。训练阶段,所有计算卡需要同步梯度数据,是典型的同步操作——一块卡速度稍慢,其他所有卡都要等待,任何异常时延都会拉低模型计算利用率(MFU)。推理阶段则分为输入预处理与逐字生成两个环节,中间会产生大量缓存数据需要在节点间搬运;用户感知到的“首字等待时间”“打字速度”,本质上都和数据传输速度高度相关。

与此同时,“以存代算”正在成为行业重要优化方向:把已经生成的中间缓存数据保存下来复用,以此节省算力。这也让存储环节加入了数据流转的链路,算力、网络、存储三者的协同效率,开始决定整个AI系统的上限。

研究表明,在大规模分布式训练中,网络通信耗时占比已达到30%—50%,网络性能直接影响算力系统的整体效率;尤其在MoE架构普及后,模型运行会产生大量高频并发的小消息通信,传统网络路径的CPU开销进一步放大,成为新的性能卡点。从这个意义上说,AI产业的竞争已经从单卡算力的比拼,进入了全链路数据流转效率的深水区。

此外,国产算力卡在工艺制程、先进封装等方面与海外顶尖产品仍存在差距,单卡性能的追赶需要长期积累。但这并不意味着整体算力能力的落后——通过系统级创新提升集群整体效能,正在成为国内AI基础设施产业的重要破局路径。

万伟坦言:“制约国产算力发展的一个重要因素,是国内外高端计算卡的单卡性能仍有差距。”在他看来,国内AI基础设施的重要发展方向,就是通过系统级创新提升整体性能,进而获得竞争优势。

这种思路正在落地为具体的技术实践。以此次发布的scaleFabric Token加速技术体系中InfiniBand GPUDirect Async(IBGDA)技术,让GPU内核直接控制网卡发起通信,绕过传统路径中CPU的指令中转,大幅降低小消息通信的延迟。这类技术恰好适配了MoE模型大量并发小消息的通信场景,相当于给数据传输打开了“绿色通道”。中科曙光方面透露,经过多场景测试,结合全链路优化后,系统整体性能可提升20%至30%。

除了算力端的通信优化,存储端的协同同样关键。针对模型加载、缓存读写、检查点存储等不同场景,行业正在形成多层次的存储加速方案,让计算单元可以更直接地访问远端存储,减少中间的数据搬运环节。这些技术共同构成了存算网协同的技术底座。

“我们采用开放架构,希望让scaleFabric网络与更多国产厂商的产品完成适配和优化,在RoCE(一种高性能数据传输技术)和NVIDIA InfiniBand之外,为产业提供高性价比的国产原生无损RDMA网络方案。”中科曙光北京公司scaleFabric产品经理纵瑞博表示,底层网络技术的自主可控,是支撑整个国产算力生态协同发展的基础。

依托scaleFabric,中科曙光自研IBGDA技术已在十万卡级集群中完成验证。

APP下载
广告
相关股票:
好投资评级:
好价格评级:
证券之星估值分析提示中科曙光行业内竞争力的护城河良好,盈利能力良好,营收成长性良好,综合基本面各维度看,估值偏高。 更多>>
下载证券之星
郑重声明:以上内容与证券之星立场无关。证券之星发布此内容的目的在于传播更多信息,证券之星对其观点、判断保持中立,不保证该内容(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关内容不对各位读者构成任何投资建议,据此操作,风险自担。股市有风险,投资需谨慎。如对该内容存在异议,或发现违法及不良信息,请发送邮件至jubao@stockstar.com,我们将安排核实处理。如该文标记为算法生成,算法公示请见 网信算备310104345710301240019号。
网站导航 | 公司简介 | 法律声明 | 诚聘英才 | 征稿启事 | 联系我们 | 广告服务 | 举报专区
欢迎访问证券之星!请点此与我们联系 版权所有: Copyright © 1996-