数据存储产业服务平台

Agent时代,存储需求会迎来新一轮增长吗?

2022年底以来,生成式AI基础设施建设的核心关键词一直都是算力。GPU数量、集群规模、训练效率以及Token吞吐等指标受到高度关注,如何获得更多算力、提高算力利用效率,成为产业投入的重要方向。

从2025年下半年开始,AI逐步从大规模训练走向大规模推理阶段,尤其Agent加速进入实际应用,产业关注点发生变化——AI系统效率不仅取决于计算本身,还与数据能否被快速存储、传输和再次调用密切相关,存储与算力的协同受到更多重视。

围绕AI存储的讨论深入到KV Cache、上下文数据、数据传输、分层存储以及生命周期管理等具体问题,存储与AI推理过程的结合变得更加紧密。

这背后对应的是AI应用形态的一次变化。

如果说Chatbot时代的核心问题是如何更快完成一次推理问答,那么Agent时代,问题变成了,那些已经算出来、未来可能再次使用的数据,如何避免再被重复计算?这也直接影响了新一轮的AI存储需求。

从一次推理到持续任务,Agent改变了数据的使用方式

传统的大模型推理,可以简单理解成一个相对明确的问答过程。一次任务结束后,其中相当一部分中间状态也随之失去价值。

Agent不同。一个Agent可能需要持续完成一个跨越数小时、数天甚至更长时间的任务。它要记住之前执行到了哪里、调用过哪些工具、获得过什么结果,还可能与其他Agent共享部分信息。

于是,AI系统的数据使用方式开始从一次生成转向持续调用。

KV Cache是其中非常典型的一类数据。大模型生成Token时,需要不断读取此前Token对应的Key和Value。如果每次推理都重新计算此前已经处理过的上下文,不仅会增加计算量,还会占用昂贵的GPU资源。因此,KV Cache本质上是用空间换计算——把已经计算出来的中间结果保存下来,在后续生成过程中直接调用。

进入Agent时代,多轮交互、长上下文和复杂任务链增加,KV Cache的复用价值进一步提升。“以存代算”因此成为提高推理效率的一种重要方式。

KV Cache存哪里?存储分层还会继续细化

数据量增加是问题的一面。另一面则是,这些数据该如何分层存储?

从算力厂商针对KV Cache构建的分层体系来看,最靠近GPU的是G1层HBM,拥有最高的带宽和较低的访问延迟,主要承载当前推理过程中正在使用的KV Cache。向下是G2层主机DRAM,当GPU显存容量不足时,可以承接部分卸载出来的KV Cache。

再向下是G3层服务器本地NVMe SSD。相比DRAM,SSD能够以更低的单位容量成本提供更大的空间,用于进一步扩展KV Cache容量。当HBM、主机内存和本地SSD都难以承载不断增长的KV Cache时,还可以向G4层网络共享存储延伸。

但随着长上下文、多轮推理以及Agent工作负载增长,G3和G4之间又出现了新的需求空间。于是,在本地NVMe SSD和传统后端容量存储之间,产业开始探索一个更加细化的共享闪存层——G3.5层,目的是让已经计算过的上下文能够快速重新进入计算流程。

如果进一步拆解Agent工作负载涉及的数据,未来存储需求可能沿着两个方向增长。

第一个方向是性能型增长。KV Cache、上下文状态、临时结果等数据的共同特点是生命周期未必很长,但可能频繁被调用。对于这类数据,决定价值的不是单纯的TB数,而是随机访问能力、延迟、并发性能以及单位功耗下能够提供多少IOPS。

第二个方向则是容量型增长。Agent不仅消费数据,也会持续制造数据。它可能产生对话记录、任务日志、工具调用结果、文档、图片、视频、代码以及新的知识内容。一部分数据可能只是中间结果,很快就会被删除;另一部分则可能进入企业知识库、RAG系统、训练数据池或者数据湖,成为下一轮AI应用的数据来源。

因此,Agent时代的存储需求实际上呈现出两种不同方向:一边要求数据更快地回到GPU,另一边要求以更低成本保存越来越多的数据。这两类需求进一步传导到SSD层,也推动企业级SSD向计算密集型和存储密集型两个方向分化。

企业级SSD布局

我们可以从闪迪(Sandisk)企业级SSD的产品布局中看到。大模型推理阶段,靠近计算、对延迟和IOPS更加敏感的场景,重点是性能。

以SANDISK® SN861 NVMe SSD为例,这款产品采用PCIe® 5.0接口,容量高达16TB,可以实现卓越的随机读写性能、低延迟和非凡的响应速度,面向大语言模型训练、推理以及AI服务部署等计算密集型场景,能够尽可能缩短存储与计算之间的距离。

 SANDISK® SN861 NVMe SSD

SANDISK® SN861 NVMe SSD同时强调以更低的能耗提供更高的每瓦特IOPS(IOPS/Watt),背后反映的也是AI基础设施评价标准的变化:企业关心的不只是单块SSD有多快,而是在既定功耗和基础设施成本下,能够支撑多少有效AI工作负载。

其新一代产品还全面支持FDP(Flexible Data Placement),通过优化数据放置降低写入放大、提高耐久性和QoS稳定性,这对于存在大量频繁写入和更新的AI工作负载同样具有实际意义。

而在数据生命周期的另一端,问题则完全不同。大量数据进入数据准备、数据湖以及长期沉淀阶段后,高随机IOPS不再是唯一优先级,容量、密度、功耗以及单位TB成本的重要性开始提高。 

SANDISK® SN670 NVMe SSD

这就是SANDISK® SN670 NVMe SSD所对应的方向。该产品基于闪迪的大容量企业级UltraQLC™平台所打造,整合BiCS8 QLC CBA NAND闪存技术、定制化控制器以及先进系统调优,单盘容量高达256TB,定位于高速AI数据湖以及AI数据准备等存储密集型应用。

未来,随着Agent进一步普及,这种产品分工可能还会继续细化。

最后

Agent时代有望带来新一轮存储增长,也将推动存储分层进一步细化。从HBM、DRAM到高性能SSD、大容量SSD和后端存储,不同层级都在向更高容量、更高性能演进,并尝试承接原本由上一层介质承担的部分数据。

每一层都在努力向上承接数据,新的存储空间,也将在这些不断移动的层级边界中打开。

未经允许不得转载:存储在线-存储专业媒体 » Agent时代,存储需求会迎来新一轮增长吗?