焦点评述
一、概念内涵
在数据洪流奔涌的智能时代,大模型训练与推理、实时数据流分析等场景持续产生海量数据,严苛的低延迟与高吞吐需求正将存储系统推向承载力的极限。以分布式存储为核心的现代存储体系,通过将数据分散部署于通用或异构硬件集群,实现了规模的横向扩展、数据的持久可靠与资源的按需供给。然而,面对超大规模应用、多元业务场景,以及可编程网络设备、异构内存、DPU等新硬件与新计算范式的挑战,下一代存储系统必须推进底层架构革新与关键技术突围。核心趋势包括:计算与存储的解耦协同以提升资源弹性,软件栈重构以释放新硬件潜能,以及引入智能算法以实现自适应调优,从而为智能世界构建高吞吐、低延迟、高可扩展的数据基础设施。
二、研究热点
当前分布式存储研究沿着硬件架构与技术场景双维度升级的路径展开,既面向AI大模型场景重构存储数据通路,也依托新型硬件重塑存储软件栈,并进一步向智能自治的高可用系统演进。
1. 面向AI大模型的高性能存储架构与数据加速
在AI大模型时代,训练与长上下文推理对存储带宽、延迟与吞吐提出极致要求,研究聚焦近数据计算、分层存储协同与数据通路优化,缓解算力与存储之间的性能鸿沟。康奈尔大学Mohammad Alian教授团队提出DReX近存储检索架构,采用软硬件协同优化思想,通过基于符号一致性的向量过滤机制,在内存层级削减冗余数据访问与计算开销,提升大模型检索场景的存储访问效率。加州大学圣地亚哥分校Hadi Esmaeilzadeh教授团队设计RAGX外存计算架构,深度利用SSD/Flash的内部并行能力与原生带宽,在外存层级直接执行嵌入检索与部分计算操作,显著减少主机与外存之间的数据搬运延迟。清华大学舒继武教授团队提出大模型存算协同优化方法论,涵盖基于流水线并行的显存扩容、基于隐藏状态的KVCache快速恢复(HCache)及分布式显存池多模型服务,大大缩短端到端推理时间。清华大学武永卫教授团队提出以KVCache为中心的“以存换算”架构Mooncake,分离预填充与解码集群并构建全局缓存池,在严格延迟SLO下显著提升有效请求处理能力。
热点代表性机构/研究团队:
[1] 康奈尔大学Mohammad Alian团队(DReX)
[https://dl.acm.org/doi/full/10.1145/3695053.3731079]
[2] 加州大学圣地亚哥分校Hadi Esmaeilzadeh团队(RAGX)
[https://dl.acm.org/doi/full/10.1145/3695053.3731032]
[3] 清华大学舒继武教授团队(HCache/Medusa/MaxEmbed)
[https://www.cs.tsinghua.edu.cn/info/1088/6644.htm]
[4] 清华大学武永卫教授团队(Mooncake/KTransformers)
[https://www.tsinghua.edu.cn/info/1175/117420.htm]
2. 新硬件驱动的存储架构与软件栈重构
DPU、CXL、NVMe等新型硬件推动存储架构从CPU中心向数据中心转型,研究聚焦存算一体、数据通路优化与存储系统全栈设计,释放新硬件的性能潜力。苏黎世联邦理工学院Lana Josipovi?教授团队联合加州大学圣地亚哥分校Tajana Rosing教授团队提出OptiPIM存算一体编译优化框架,面向DRAM存算一体架构将算子映射问题转化为可自动求解的优化任务,自动生成适配硬件特性的可执行代码与最优数据布局。NVIDIA联合谷歌、英特尔、Meta组成的Storage-Next团队推动cuFile API开源与STX存储架构标准,基于BlueField-4存储处理器实现GPU直连存储的在网数据处理,重构AI场景下的存储访问软件栈,优化小扇区读写与上下文存储性能。中科曙光存储团队推出ParaStor F9000全闪存储系统,通过定制硬件重新排布网络与NVMe协同通路,结合全链路数据编排技术实现I/O子域隔离,配套精细化调度软件栈释放新硬件的全部性能潜力。
代表性机构/研究团队:
[1] 苏黎世联邦理工学院Lana Josipovi?联合加州大学圣地亚哥分校Tajana Rosing团队(OptiPIM)
[https://dl.acm.org/doi/full/10.1145/3695053.3731041]
[2] NVIDIA Storage-Next联合团队
[https://scaleflux.com/technology/what-is-storage-next/]
[3] 中科曙光存储团队(ParaStor F9000)
[https://www.51cto.com/article/847838.html]
3. 存储系统的高可用性与智能自治运维
存储规模扩张与异构架构复杂度提升,使得传统人工运维难以应对故障风险与效率压力,研究聚焦AI驱动的故障自愈、智能调度与全生命周期自治管理,保障业务连续性并降低运维成本。IBM存储研究团队推出FlashSystem.ai智能运维体系,内置基于watsonx与Granite 4.0模型训练的专用AI引擎,实现系统状态感知、故障预警、策略自动配置与勒索软件检测的全流程自动化,可大幅减少手动运维工作量。HPE研究团队提出基于时序模型(IT-TSFM)与大语言模型的存储基础设施自愈方案,通过分析遥测数据识别“灰色故障”模式,捕捉传统监控易忽略的性能退化信号,提供上下文感知告警与修复建议,实现主动式运维与故障提前干预。阿里云与上海交通大学联合研究团队提出Latte混合存储架构,结合本地存储的高性能与云端存储的高可用能力,通过统一数据路径与调度机制实现自动故障切换与弹性扩展,提升分布式存储的运维效率与业务连续性。
热点代表性机构/研究团队:
[1] IBM存储研究团队(FlashSystem.ai)
[https://www.51cto.com/article/841944.html]
[2] HPE研究团队(IT-TSFM自愈方案)
[https://observability.com/news/self-healing-it-hpe-research-explores-how-ai-trained-models-can-catch-silent-infrastructure-failures/]
[3] 阿里云与上海交通大学联合研究团队(Latte架构)
[https://www.usenix.org/system/files/fast26-yang.pdf]
三、发展趋势
下一代分布式存储正从面向通用负载的“容量型”基础设施,演进出“性能-容量-可靠性”三位一体的智能数据底座,架构敏捷性、硬件亲和性与运维智能化构成核心主线。
1. 云边协同与跨域联邦的分布式存储架构
数据产生与处理正从集中式云数据中心向边缘和终端迁移,分布式存储的未来形态将突破单一数据中心的边界。云边协同场景要求存储系统具备跨地域、跨层级的数据管理能力,实现边缘与中心云之间的数据按需流动与统一命名空间;借鉴数据联邦理念,不同机构、不同地理位置的存储资源可通过标准协议实现互联互通,形成逻辑统一的存储池。芝加哥大学SHARED平台已通过OSDF与Globus等工具接入国家级计算生态,为此提供了可行范例。这一趋势将驱动存储系统从“单一集群”向“联邦化存储网络”演进,对跨域元数据管理、安全隐私保护与数据主权治理提出全新要求。同时,存算分离架构的深化将进一步解耦计算与存储生命周期,使两者可按各自最优节奏独立扩展,提升整体资源利用率。
2. 面向新硬件的全栈重构与标准化
随着CXL、DPU、持久内存等新硬件逐步成熟,分布式存储系统正经历从“适配硬件”到“原生设计”的范式转变。软件栈将从传统多层内核路径演进为用户态、事件驱动的轻量级数据路径,充分释放新型高速设备性能。在数据拷贝与上下文切换方面,零拷贝、RDMA、GPU-Direct等技术的深度整合有望将存储访问延迟大幅度缩减。在网计算能力的增强使部分存储语义下沉至网络设备,实现数据“边传边算”,显著降低搬移能耗与时延。标准化层面,NVMe-oF、CXL等开放互联协议的成熟将推动异构存储资源池的互联互通,降低厂商锁定风险,使数据中心能够灵活组合最优存储组件。
3. AI驱动的存储自治与效能可持续
人工智能正从辅助运维工具演进为存储系统的“内嵌大脑”,驱动无人化自治运营。基于大规模运维数据的预训练模型可提前预测磁盘故障与性能抖动,将被动响应转变为主动预防。系统亦能依据应用SLA自动选择最优数据保护策略、存储介质与数据放置位置,实现性能、可靠性与成本的动态平衡。在效能可持续方面,“双碳”目标使绿色存储成为关键考量。未来存储系统将感知数据访问热度的时空分布,通过智能数据分层、节点休眠与可再生能源优先调度,在保证服务质量的前提下最小化能耗与碳排放,实现高性能与可持续发展的协同共进。
编委主任:
苏金树 CCF会士 军事科学院教授
本期主编:
程葛瑶 CCF分布式计算与系统专委委员 信息支援部队工程大学网络信息体系创新研究中心副研究员
曾德泽 CCF分布式计算与系统专委副主任委员(执行) 中国地质大学(武汉)计算机学院教授
点击底部阅读原文,有兴趣的都可以免费学习
目录
点击“阅读原文”浏览《CCF数图焦点》第122期详细内容。
