2026年8月26日,在2026全球闪存峰会上,华中科技大学教授、计算机学院存储所所长王芳发表了题为《面向智算的高性能存算系统》的演讲。她指出,随着人工智能成为战略性技术,医疗、自动驾驶等关键领域对模型精度的要求越来越高,这直接推动了模型和数据规模的急速增长——图神经网络已发展到十亿级顶点,大语言模型需要处理万亿级Token。智算系统从过去主要追求算力提升,转向同时追求计算效率和数据存取效率,存储也因此成为AI基础设施中越来越关键的一环。

然而,各类算力资源快速发展,存储侧供给数据的能力却越来越跟不上,形成了业界共识的“存储墙”问题。在智算场景下,这一问题具体表现为三个方面:异构算力资源利用率低、AI任务与存算资源适配性差、存储层次不断丰富导致性能和成本难以兼顾。围绕这三大难题,王芳团队开展了一系列研究与实践。
破解算力闲置:让采样与训练形成反馈闭环
图数据广泛存在于现实世界,对图数据的分析是智算时代的重要应用。图嵌入是大规模图数据分析的重要基础技术之一,通过将高维稀疏图数据映射到低维稠密向量空间,为链接预测、推荐、检索增强等任务提供支撑。面对大规模图数据,传统图嵌入过程耗时长、内存消耗大,在十亿级规模图数据集上,训练时间超过一个月。

华中科技大学教授、计算机学院存储所所长王芳
王芳团队分析后发现,传统图嵌入系统存在三个核心问题:采样和训练相互独立,采出数据不一定对后续训练有用,形成大量冗余计算;随机游走采样和分布式训练产生大量跨节点访问,通信成本高;CPU负责采样、GPU负责训练,两者存在依赖关系,易出现停等导致算力闲置。
针对这些问题,团队提出了采样-训练信息耦合互馈的分布式图嵌入系统FeLoG。其核心是改变传统采样和训练相互独立的执行方式,构建一个闭环反馈机制。在每轮训练过程中,会观察生成嵌入向量与原始图结构间的相似性变化,评估学习到的嵌入向量对图结构信息的捕获质量。当新增采样不能显著提升嵌入质量时,就减少或终止这部分计算。王芳在演讲中强调:“这里的关键不是把采样操作本身做得更快,而是通过训练阶段的反馈提前避免无效采样动作,从源头上减少冗余计算。”
此外,团队还提出了活跃度感知的通信机制。图嵌入训练中的通信具有显著不均匀性:生成路径中不同顶点出现频率显著不同,训练同步过程中不同嵌入向量的更新频率也显著不同。基于这一观察,系统根据顶点出现频率进行位图压缩,降低CPU-GPU间的数据传输量;根据嵌入向量更新热度进行差异化同步,减少节点间的不必要通信。实验结果表明,相比Meta的PyTorch-BigGraph、亚马逊的DistDGL等主流系统,FeLoG可以获得平均28.8倍的性能加速,通信开销平均降低53.1%,CPU和GPU利用率均维持在80%以上。
适配异构存储:用熵感知应对稀疏访问挑战
第二个难题是AI任务和存储资源之间的适配性差。目前的存储和内存介质越来越呈现异构性,AI应用中大量随机访问的稀疏计算会放大不同存储介质之间的性能差异。同时,传统缓存通常只看到地址和访问频率,却看不到AI算子本身的语义,导致访存效率低下。
以DRAM和持久内存组成的异构内存为例,PM读写带宽明显低于DRAM,一旦把数据简单放到PM上,性能会急剧下降。图数据固有的稀疏性引入大量随机访问,致使线程分配中突出的负载不平衡和尾部延迟问题。NUMA架构下,PM与DRAM的性能差距被进一步放大。
为此,团队构建了面向十亿级规模的异构内存图嵌入系统OMeGa。其中一项关键技术是熵感知的线程任务分配策略。传统轮询方案简单,但由于图数据具有无标度特性,不同行中非零元素数量差异很大,极易造成线程间负载不平衡。如果仅按照非零元素数量追求绝对负载均衡,又忽略了访问的稀疏程度——表面上每个线程计算量差不多,但实际内存访问效率完全不同,最终产生严重尾部延迟。
团队对图嵌入过程中的基础算子稀疏矩阵与稠密矩阵乘法(SpMM)进行了分析,发现无论DRAM还是PM,访问稠密矩阵元素操作成为主要瓶颈。即使线程之间的非零元素数量完全相同,只要这些访问更加离散,实际执行时间就会明显增加。因此,线程调度不仅要考虑“有多少计算”,还必须考虑“这些计算对应的数据访问有多离散”。团队引入熵值来量化工作负载的稀疏性。实验观察也发现工作负载的熵值与执行时间呈线性关系。在负载均衡方案的基础上,通过评估负载熵值动态调整任务,OMeGa在工作负载均衡和减少尾部延迟之间取得了良好平衡。
此外,团队还设计了负载特性感知的预取机制。由于DRAM和PM性能差距大,频繁在两层之间搬运数据会产生额外开销。通过频率和顶点度等信息,识别SpMM执行过程中稠密矩阵元素中的高复用数据,提前放入DRAM,用少量DRAM资源覆盖真正影响性能的高频访问数据。实验结果表明,OMeGa在所有测试数据集上平均获得32.03倍加速,DRAM和PM之间原来数量级的系统性能差距被显著压缩到54.9%。
兼顾性能与成本:面向训推一体的数据存储引擎
第三个问题来自存储系统本身。AI应用的数据特征具有实时性、大规模、高并发及多模态特征,系统既需要高性能,又需要低成本、高弹性及统一管理。存储介质从单一向多层次发展,架构从本地走向分布式和存算分离,新的层次带来了垃圾回收、网络通信以及多模数据组织等额外成本。
王芳团队重点研究了一个典型的训推混合新场景——大推荐模型(LRM)。随着生成式AI进入推荐系统,原来相对独立的训练和在线推理服务开始逐渐融合。训练任务强调吞吐,在线推理强调尾部延迟,两者对用户行为序列和KV Cache的访问模式差异明显,共享同一存储系统时会产生资源竞争和相互干扰。传统只针对某一种负载设计的存储引擎,很难同时满足高效训练、推理以及成本控制三个目标。
针对这一需求,团队设计了面向LRM训推一体的统一数据存储引擎TokaDB。在数据组织方面,团队采用分离式分段索引布局,解耦数据本身的组织和索引组织。一方面按照用户维度维护局部性,让同一用户的数据能够快速定位,保证在线点读性能;另一方面按照时序分段后构建索引,使训练时能够进行连续的范围扫描。这样在同一份数据上同时支持保留了用户级内部数据的局部性和跨用户时间维度上的局部性。
针对长期运行后数据分散的问题,团队进一步根据访问时间和热度对数据进行重组和冷热分层,热数据重点保证在线访问局部性,冷数据则更多考虑容量和成本效率。在降低成本方面,面向实际业务场景中希望更多利用HDD,但HDD直接支撑在线业务存在明显性能瓶颈。团队提出能效协同I/O引擎,通过自适应备份读取避免长尾等待,采用日志即数据的方式减少写放大,根据KV Cache和物理块大小进行对齐减少跨块读取。同时,系统通过抢占式线程调度、层次化缓存分配和多层速率限制协调训练与在线服务的资源使用,缓解不同优先级工作负载之间的相互干扰。端到端测试表明,TokaDB在两个负载下都获得了最佳性能,与对比系统方案相比获得4到9倍的性能提升。
总结:从分层优化走向纵向协同
在演讲总结中,王芳教授指出,计算侧提高异构资源利用率、数据访问侧实现AI算子与异构存储资源适配、存储系统侧兼顾性能成本和弹性,这三个方面共同构成了面向智算的高性能存算体系。CPU中心向GPU/NPU等加速器多中心演进,多算力、多介质、多协议将长期共存,传统以CPU为中心的数据访问体系已难以适配新型智算任务。

华中科技大学教授、计算机学院存储所所长王芳
在演讲总结中,王芳教授指出,团队近年来面向图计算、深度神经网络和大模型等智算任务,从应用模型、异构计算和异构存储三个层次持续开展研究,逐步形成了面向高性能AI系统的应用—计算—存储协同技术体系。她认为,未来智算系统将继续由CPU中心向GPU/NPU等加速器中心演进,多算力、多介质、多协议将长期共存,传统以CPU为中心的数据访问体系越来越难以适配新型智算任务。
下一步,团队希望面向加速器重构数据供给体系,构建跨算力、跨介质、跨协议的统一数据访问通路,实现数据按需选路、直达算力,推动应用、计算与存储从分层优化走向纵向协同,持续提升智算系统整体效率。【根据录音整理】




