英伟达开源cuFile加速AI数据传输效率
在FMS 2026峰会上,英伟达宣布将GPU存储加速API cuFile全面开源,并推出全新的SCADA存储架构,该架构通过GPU直接主导数据传输流程,从根本上解决了传统模式下由CPU调度造成的性能瓶颈问题。
技术革新突破存储瓶颈
长期以来,GPU设备必须通过CPU来调度数据读取任务,这种"宿主模式"在处理人工智能推理过程中产生的大量512字节微小请求时,导致微秒级别的延迟问题。虽然GPUDirect Storage技术可以绕过数据传输中的CPU环节,但其指令控制环节仍依赖CPU,导致在处理小规模读写任务时仍然会触发系统性能瓶颈和IO资源调配问题。
性能数据展现明显优势
实际测试显示,在搭载SCADA新架构的系统环境中,GPU存储IOPS性能最高可实现5倍提升。这一突破性进展为人工智能应用提供了更高效的底层技术支持,有望显著提升计算密集型应用场景下的整体运算效率。

GPU与NVMe硬盘协同技术SCADA显著提升数据分析效率
美光展示创新SCADA技术
设计,允许GPU直接发起存储I/O请求,有效管理NVMe硬盘队列深度,实现传统CPU触发模式无法达到的性能增长。实测数据显示,该技术在数据分析任务处理中,速度达到传统模式的5.3倍。
硬件成本降低及效能提升
在本次展示中,3颗H100显卡驱动44块PCIe Gen6 SSD,实现2.3亿次随机读IOPS。此架构下的单台服务器存储吞吐量达到118GB/s,负责调度的CPU利用率几乎为零。
SCADA技术革新实现了显著的成本优化,最高可将硬件成本降低至传统架构的原有水平。
NVMe硬盘队列深度管理是新型GPU原语支持的关键突破,它打破了传统I/O模式的限制,为高性能计算提供了全新解决方案。
- 技术特点:允许GPU直接发起存储I/O请求;管理NVMe硬盘队列深度
- 性能表现:处理速度是CPU触发模式的5.3倍;实现2.3亿次随机读IOPS
- 硬件指标:单服务器存储吞吐量达118GB/s;CPU几乎处于空闲状态
数字显示基于SCADA架构的服务器实现了过去无法想象的吞吐量,同时实现了前所未有的硬件成本优化。

英伟达推出GTC大会构想Storage-Next联盟,40家厂商协力解决小数据读写瓶颈
在2025年GTC大会正式提出构想后,英伟达宣布成立Storage-Next产业联盟,聚焦于优化512字节扇区读写表现。传统存储设备在4KB扇区下存在8倍读取放大问题,新联盟聚焦解决小型数据块访问矛盾。联盟成员包括铠侠、美光、DDN等多家存储厂商,以及存储控制器供应商、散热厂商和标准化组织,各方将开发适配GPU存储访问架构的新标准。
新架构应对计算存储分离趋势
作为现有NVMe体系的升级路径,Storage-Next通过接口协议调整解决cuFile生态与SCADA架构部署兼容性问题。Key Value数据缓存机制需要更小粒度的磁盘操作,在存储处理器层面,NVlink架构替代PCIe实现双倍带宽,BlueField-4处理器承担本地数据缓冲,超低延迟设计特别适合AI推理场景。联盟通过联合开发控制器芯片与散热片,在保证计算效率前提下降低能效指标。
商用整机采用STX架构将于2026年面世
STX架构采用全重新设计的方式解决现有NVMe标准与AI需求匹配度不足的问题,硬件层整合NVMe over Fabrics与RDMA协议,深度融合system level协同设计与安全加密特性。合作方铠侠将迁移原IDEA SSD控制器架构,DDN将推出配套存储管理软件DCP6,用于监控存储资源利用率。联盟规划三个阶段实施路线图:2025年完成技术验证,2026年上半年实现样品测试,下半年正式交付商用系统。
联盟响应2025年GTC大会中「存储架构与AI算力绑定」的发展理念,通过协作定义下一代GPU存储接口规范,构建跨厂商互操作生态系统。
根据联盟初步规划,新标准从存储介质至访问控制全部重建,QLC颗粒封装密度提升技术重点布局在四个维度:按需分层存储架构、分布式元数据管理机制、动态磨损均衡算法、端到端数据路径优化。

新技术进展:英特尔入局开源阵营 构建新一代AI存储架构
英特尔宣布加入某开源组织参与代码维护,标志着基于英伟达私有技术的cuFile与SCADA,逐步成为全行业通用开源标准,从而有效改善了跨平台兼容性。
技术进展剖析
该技术的发展带来了服务器硬件架构的新变化,尤其是对cpu主导io调度格局提出了挑战。cuFile与SCADA相关技术的开源化,使得全行业能够实现通用标准。
根据前期资料,新一代ai存储架构需要解决两大关键问题,才能实现规模化普及。
商用普及两大制约因素
首先,stx+scada新架构的跨硬件、跨平台适配优化进度决定技术落地速度。其次,美光、三星等厂商能否在针对512字节小包场景方面完成主控与固件的底层重写,是技术普及的关键。
这两点因素将共同决定新一代ai存储架构的商用普及节奏。业界需持续推进相关器件适配与代码优化进程,以实现技术的全面市场化应用。
