数据存储产业服务平台

打通从数据到智能的“最后一公里”,自戴尔科技智能数据平台开始

企业都在追逐智能化,如何才能够快速见效?

如果“拿来主义”可行,事情是否就简单了很多?

诚然,理想丰满,现实骨感。对企业而言,智能化并非能够拿来即用的“舶来品”,真正决定智能应用能否落地的,在于企业能否将自身的数据与业务场景有效结合。通用模型可以直接采用、强大算力能够持续投资,但企业专有的数据、业务知识和上下文无法从外部“拿来”。从分散的数据源,到经过准备、处理、编排的就绪数据,再到能够被智能应用持续调用的“燃料”,中间仍有一段“最后一公里”路程需要打通。这不仅需要对企业数据与业务场景的深入理解,也需要构建起完整的数据基础架构,企业智能化很难一蹴而就。

智能应用需要更可靠的数据基础:私有云或混合云成为重要选择

都说万事开头难,企业智能化也需要一个出发点:数据在哪里,以及如何安全高效地利用这些数据。当前,企业基于成本、性能与数据控制力需要,开始重新审视工作负载的部署位置,甚至开启规模化“云回迁”,让部分工作负载回归本地,云战略也从简单的“云优先”转变为“云智能”。

尤其是在数据库、业务知识、提示词甚至上下文都在成为企业核心数据资产的当下,企业用户对于数据隐私性更为敏感,也需要更好的掌控权,在这样的背景下,私有云或混合云,就成为了理想选择,可以很好地满足管理与成本的需要。

不仅如此,企业智能化离不开专有数据。无论是基于通用大模型结合企业专有数据构建RAG等应用,还是针对特定场景进行微调与优化,数据都是连接智能能力与实际业务场景的重要纽带。

让数据释放智能价值

因为此前数字化应用的长期积累,企业对于私有云并不陌生,但作为智能化平台,将原始数据升级为智能就绪的数据,由此需要配套哪些内容,很多企业会感觉无从入手。企业在智能化落地实践中逐渐意识到,真正阻碍智能应用跑通的,往往并非模型本身,而是作为“智能燃料”的数据。

戴尔科技集团大中华区非结构化数据存储事业部产品经理李海表示:“今天很多企业级用户开展智能化项目时会发现,卡住智能应用落地的往往不是模型也不是算力,而是数据。如何把企业本地的数据高效、可靠地输送到智能模型与应用当中,是摆在很多企业面前的现实难题。”

戴尔科技集团大中华区非结构化数据存储事业部产品经理 李海

数据孤岛问题便是最为棘手的挑战之一。经过多年IT建设,企业数据散落在ERP、SQL Server、业务日志、对象存储等多种系统之中,这些数据的大小不一,格式不一,还和对应应用系统紧密绑定。随着数据规模持续增长,“数据引力”效应越发明显——大规模搬迁数据的成本、时间和复杂度不断增加,企业很难简单地把所有数据集中到一个位置再供智能应用使用。

其次是如何让数据真正“就绪”。拿到原始数据以后,往往还要完成清洗、格式转化、丰富、标注等一系列处理,还可能涉及向量化处理与向量索引构建等步骤,才能最终“投喂”给大模型使用。面对海量数据,如何高效完成这些数据准备工作,是企业推进智能项目的又一道门槛。

与此同时,智能应用势必涉及自动化编排——智能应用的数据处理链路并非一次性环节需要跟上业务7×24小时不断变化的节奏,并随业务数据的更新持续向模型输送新鲜数据。想要完成这套不间断的流程化运转,完整成体系的数据编排能力必不可少。

因此,企业智能应用的落地需经历一个能打通数据到智能“最后一公里”的中间环节,戴尔科技智能数据平台由此而来。

戴尔科技集团大中华区信息基础架构解决方案事业部存储业务总经理刘志洪补充指出,“在产品定位上,戴尔科技智能数据平台所做的是打通智能应用‘抓取’数据的路径,保证数据供给。智能应用会调取数据库数据、现场图片,甚至是工程师曾撰写的一篇文章,因此需要解决这些数据零散分布的孤岛问题。戴尔科技智能数据平台选择的并不是在完成一件事情时,将所有数据移动至一处,而是通过一个路径,让平台主动找数据,直接供给计算资源,而非让数据大规模移动。”

戴尔科技集团大中华区信息基础架构解决方案事业部存储业务总经理 刘志洪

智能数据平台支持各种存储,如块存储、文件存储、对象存储——存储引擎因而担任底层支撑角色,目前由Dell PowerScale、Dell Lightning File System(Dell Lightning FS)等多类产品组成,选择哪一个取决于企业工作负载的类型、企业业务规模和性能需求。

智能数据平台还借助数据引擎(含分析、处理及搜索三个子引擎)协调数据在整个智能应用生命周期以及在云端、本地和混合环境中的数据发现(discover)、准备(prepare)、丰富(enrich)、同步(synchronize)和治理(govern),从而最终把原始企业数据转化为团队真正能使用的数据。

“当使用过这三个数据引擎后,还需要通过编排引擎把这些功能串起来,实现自动化的流程,如自动化的数据标注。”李海补充道。

在数据引擎之上,戴尔科技智能数据平台的数据编排引擎负责把数据管道、模型、检索系统与人工反馈回路连接起来,编排从摄取、准备、丰富到创建、训练、发布的完整生命周期,确保智能系统始终调用新鲜、生产就绪的企业级上下文。

以高级驾驶辅助系统(ADAS)场景为例,每辆汽车每天采集几十个TB的数据(上千张照片或视频),涉及天气、红绿灯、障碍物等多种信息,大部分数据会借助智能模型进行标注,但仍有少部分需要人工介入识别,对模型进行监督学习和训练,这就形成了“人机协作(human in the loop)”的互动模式,为ADAS决策提供更好、更准确的数据准备。

如今,很多企业基础架构所面临的瓶颈不再是计算不够快,而是原始数据未经处理,大量不就绪的数据散落各处,始终无法形成一条完整的数据管道(data pipeline),无法串联起整个智能应用生命周期,从而导致算力在等待数据的过程中空转,造成浪费的同时,智能化转型也停步不前。

戴尔科技智能数据平台,则通过统一承载存储、数据引擎、治理与安全能力,为智能数据的完整生命周期提供了统一承载与系统化支撑,帮助企业打通智能“最后一公里”。

小结

从数据到智能,现代化数据中心、智能数据平台,这些现阶段企业既熟悉、又陌生的解决方案,正在成为化解智能化落地挑战的关键支撑。之所以熟悉,是因为智能应用所需的算力、数据还始终依赖这些环境;为什么会陌生,是因为不少企业还不洞悉数据的使用方法,没有做好必要的准备工作,导致智能化止步不前。

都说千里之行始于足下。对企业而言,智能化还要回归数据基础架构与数据就绪能力的建设上来。如今,算力、模型已经万事俱备,所欠缺的唯有数据就绪这最后一公里的东风!而戴尔科技智能数据平台所要解决的,正是这一问题。

未经允许不得转载:存储在线-存储专业媒体 » 打通从数据到智能的“最后一公里”,自戴尔科技智能数据平台开始