数据存储产业服务平台

极致存力,不负算力:得瑞领新力推AI时代SSD的范式演进

从1950年到2010年,AI模型训练数据集大小每年平均增长1.3倍;而2010年到2025年,这一增速跃升至每年2.7倍,GPT-4已迈入万亿参数规模。

得瑞领新CTO薛红军在2026全球闪存峰会上发表演讲

2026年8月,在2026全球闪存峰会上,得瑞领新CTO薛红军在题为《极致存力,不负算力——AI时代SSD的范式演进》的演讲中展示了这一组数据后表示,训练数据的爆炸式增长,对存储产业提出了历史性挑战。预测显示,AI推理需求将以每年56.2%的复合增长率增长,未来将成为NAND需求的最大驱动力。

当算力边际效应递减,存储成为决胜关键,如何多维度优化SSD以释放AI潜能,成为核心命题。薛红军从微观技术层面切入,聚焦SSD内部的核心算法优化,探讨如何让存储更好地满足AI负载需求。

AI工作负载带来的三大挑战

薛红军认为,AI应用对SSD提出了性能、延迟和寿命三方面的严苛要求。

得瑞领新CTO薛红军在2026全球闪存峰会上发表演讲

性能方面,场景高度分化。训练阶段侧重高顺序带宽,用于读取数据集和Checkpoint;推理阶段则依赖高随机IOPS,特别是向量RAG场景下的混合读写负载。KV-Cache卸载对4K/16K小IO随机读性能提出更高要求,需要优化低队列深度下的响应能力。

延迟方面,任何抖动都会直接造成GPU气泡、算力浪费和首Token延迟恶化。顺序读写关注平均延迟,随机读写则更关注99%和99.9%的尾部延迟。KV-Cache卸载场景中,任何延迟抖动都会直接拖累GPU算力效率。

寿命方面,每日全盘写入次数(DWPD)成为核心衡量指标。普通推理场景需要DWPD 1-2,向量库RAG场景需要DWPD 2-5,而KV-Cache卸载场景的写入强度极高,DWPD需求高达3-10。

应对策略:SSD核心算法优化

针对上述挑战,薛红军介绍了得瑞领新在SSD内部算法层面的系统应对策略。

高性能方向,得瑞领新采取全局优化OP策略。优化元数据直接降低元数据空间占比,增加OP空间;动态分合流机制在特定场景下合并open块,降低空间浪费;Page retire技术将失效页标记退役而非直接报废整个Block,配合Dummy数据补齐,使剩余页继续使用;RAID降级机制在出现坏块时自适应降级(如从31+1降为30+1),避免Super Block整体报废。此外,采用SRAM和DRAM混合Buffer形式,将高频访问数据放入纳秒级延迟的SRAM中,大幅降低访问延迟。在大映射粒度下的FTL算法优化中,通过动态时延合并策略将相邻4K写入合并,减少NAND读取和改表次数。数据排布优化则将数据分散到多个NAND die上,提升并发访问效率。智能中断聚合技术将多个IO合并为一个中断,单盘性能提升45%,多盘场景下提升超过60%。应用这些技术后,得瑞领新Gen5 TLC产品的随机写IOPS比行业平均值提升40%以上,QLC产品顺序写提升40%,随机写提升95%。

低延迟方向,得瑞领新采用自适应命令调度策略,在全链路上优化前台与后台请求的优先级控制,根据用户负载和读写比例动态调整。智能预读策略通过监控主机workload行为,提前将用户数据读入NAND Data Register或DRAM,使顺序读延迟降至5μs以内。Overlap Write场景下的数据去重技术,在热数据频繁重写时通过缓存减少NAND写入次数,降低写放大和时延。FTL L2P Table的Prefetch与Cache机制类似CPU的L1/L2 Cache,将热映射表放入SRAM,大幅降低地址转换延迟。定期更新VT技术,通过后台识别NAND错误并更新最优VT,在3个9和4个9的QoS优化上效果显著。动态Suspend策略则根据主机负载自适应调整Suspend时机和插入点,确保用户读写QoS最优。优化后,TLC产品随机读4个9延迟降低30%以上,随机写降低40%以上。

高寿命方向,核心在于冷热数据识别与隔离。根据写入时间戳、访问频率、最近访问间隔和写入块大小等维度,得瑞领新对用户数据进行加权评分,识别出热、温、冷三类数据,并分配完全独立的物理块池,实现物理隔离。同时支持动态配额调整,根据训练阶段自动调整三类块池的空间占比。冷热数据隔离后,写放大从JESD219A无优化时的4.11降至2.39,相比无优化寿命提升超过70%。

技术产品化落地:PCIe 5.0完整解决方案

目前,得瑞领新已经将上述算法优化全面落地于PCIe 5.0产品线。

TLC系列(D8436/D8456)覆盖3.84TB至15.36TB,顺序读写分别达到14.5GB/s和10.5GB/s,随机读写IOPS最高3400K/1150K,随机读写延迟分别为47μs和4μs,4个9QoS延迟控制在0.3ms以内,D8456系列支持3 DWPD。QLC系列(D8433)覆盖15.36TB至122.88TB,顺序读写达14.2GB/s和5GB/s,随机读IOPS达3400K,16K随机读延迟100μs,DWPD为0.6,平均无故障时间250万小时,不可纠正误码率低于10-18

从算法到产品的全链路优化             

从全局OP优化、SRAM/DRAM混合缓存、冷热数据识别,到智能中断聚合、自适应调度和动态Suspend,每一项技术都指向同一个目标:让SSD在AI工作负载下实现极致性能、超低延迟和长久寿命。

【编后:

以“存力跃迁,AI破局”为主题的2026全球闪存峰会(Flash Memory World 2026)由DOIT传媒、华中科技大学计算机科学与技术学院、华中科技大学集成电路学院联合主办,大会主论坛汇聚中国工程院院士,华中科技大学、杭州电子科技大学等专家学者,除得瑞领新之外,还吸引了Solidigm(思得)、华为、慧荣科技、天翼云、紫光闪芯、联想凌拓、浪潮信息、中科曙光、数合泰等存储全产业链力量,与各界代表共探AI时代存储技术与产业的新一轮变革。】

未经允许不得转载:存储在线-存储专业媒体 » 极致存力,不负算力:得瑞领新力推AI时代SSD的范式演进