7月16日,“数据工厂研讨暨《数据工厂白皮书》发布会”在北京交通大学举行,由北京交通大学、北京化工大学、华为等单位参与编纂的《数据工厂白皮书》(下简称“白皮书”)正式发布。会上,华为分布式存储领域总裁杨文道受邀参与发布仪式并发表主题演讲。

华为分布式存储领域总裁 杨文道
随着AI技术迈入Agentic AI时代,高质量数据集已成为驱动智能跃迁的“核心燃料”。白皮书指出,数据工厂将是数智化发展新阶段的一种基本生产业态,由储备车间(数据汇聚与存储)、生产车间(数据加工与标注)、中试车间(数据测试与验证)组成,旨在实现高质量数据集的规模化、设施化、标准化生产,提供面向大规模数据资源的存储、治理、加工、流通等服务能力。
同时,白皮书系统阐述了数据基础设施在数据集供给体系中的关键作用,明确提出需通过机制创新与技术升级,破解多模态数据孤岛、跨域流动低效与加工周期长等行业痛点。
杨文道指出,当前数据供给仍普遍存在留存率偏低、行业数据匮乏、共享机制不畅、数据泄露风险突出等显著问题,企业亟需构建覆盖数据“存-治-用”全链路的闭环体系,并同步部署与之适配的数据基础设施,进而系统性破解高质量数据供给瓶颈。
首先,需破解“聚数之困”:打造具备高容量密度与低功耗特性的海量数据存储,支持文件、对象、大数据多协议无损互通,提供统一、开放的数据湖表格式,实现EB级多模态数据绿色、高效地长期留存,从而为数据工厂的“储备车间”稳定供给数据生产资料。
其次,需化解“治数之难”:需构建统一数据空间,实现跨域数据全局可视,具备千亿千维向量数据秒级检索能力。通过数据血缘追踪、版本管理等机制,彻底打破数据烟囱,让数据“入湖即可见、随用随取”,大幅降低高质量数据集的构建周期与成本,为数据工厂的“生产车间”提供高效的加工与调度中枢。
最后,需根除“用数之痛”:需要构建可信数据空间,支持对大规模文件进行加密传输与精细化权限管控,实现数据“可用不可见”的能力,加速高质量数据集的流通供给与价值闭环。
为满足数据工厂建设的核心需求,华为推出AI数据湖解决方案:基于OceanStor Pacific全闪分布式存储,达成11PB/2U业界最高容量密度与0.25W/TB超低功耗;依托DME Omni-Dataverse统一数据空间实现跨域数据高效治理;提供可信数据空间,让数据跨域流通可信、可控、可证。通过一套架构完成”存好数、治好数、用好数”流程闭环,为高质量数据集的规模化供给提供坚实的技术底座。
“数据工厂”理念的提出,标志着AI数据供给方式正从分散化、定制化的“项目制”向持续化、标准化的“产品制”跃迁。数据正从静态的存储资源,升级为驱动大模型训练、赋能智能体决策的关键生产要素。华为将坚持以技术创新为驱动,以开放合作为理念,助力数据工厂从概念走向现实,促进数据要素价值高效释放,加速千行百业的智能化转型。


