HDD与NAND闪存:为何AI数据中心两者皆不可缺

区块链文库报道:

AI数据中心需要硬盘与闪存各司其职

AI数据中心既需要硬盘驱动器(HDD)也需要NAND闪存,因为两者解决不同的问题。闪存提供低延迟和高IOPS,用于向加速器输送模型权重、键值缓存和向量索引。HDD则为庞大的训练语料库和长期运行产生的输出提供最廉价、最可持续的每TB容量——这些数据会随着模型运行而不断增长。厂商将这种设计描述为分层架构:闪存加深存储堆栈,而非取代容量型磁盘。

成本与可持续性:HDD仍是容量层的基石

某厂商报告显示,HDD每TB的采购成本比基于NAND的SSD低约6倍,并强调在超大规模场景下,HDD的每TB能耗和隐含碳排放显著更低。在性能和耐久性方面,闪存在半导体单元中存储电荷,提供极低延迟和高随机IOPS,但会随着使用而磨损,因此需要控制器、纠错码、磨损均衡和预留空间来管理寿命,某厂商对此有详细说明。综合来看,各运营商的指导模式一致:小尺寸、延迟关键的数据放在靠近计算的闪存上,而体量更大的批量层则存储在基于HDD的对象存储或文件系统中。某厂商描述了AI管道的这种拆分,同时某AI加速器的最佳实践和某云架构均建议将暂存和缓存放在SSD上,而将数据集和归档保留在基于HDD的系统上。

双层AI存储堆栈的工作原理

多层设计将存储介质与数据温度对齐。闪存位于GPU旁或高性能网络结构上,为热数据提供低延迟服务,如模型权重、KV缓存和向量数据库。冷温层和温层则容纳其他所有内容:训练数据集、合成语料库、推理输出、实验日志和合规归档,均存储在容量型HDD池中。某厂商描述的正是这种模型,并指出闪存扩展了堆栈,而HDD容量仍在持续增长。操作指南与此架构相匹配。某厂商建议将训练数据暂存到本地或网络NVMe上,并缓存热子集,以避免小文件和网络I/O瓶颈。检查点突发写入以及其他高吞吐、短寿命的写入通常由闪存承担,随后迁移到容量型HDD层进行保留。在云环境中,某云展示了相同的模式:使用基于HDD的对象存储存储大数据集和长期保留数据,而训练和推理则通过基于闪存的缓存或托管的高性能文件系统来服务,并针对大顺序读取和批处理优化访问模式。

HDD在AI管道中的价值

HDD通过旋转盘片以磁性方式存储数据。其优势在于容量密度和每TB成本效率,使其成为批量数据的经济支柱。某厂商报告显示,在超大规模容量场景下,HDD每TB成本比NAND SSD低约6倍。同一来源还强调,HDD的每TB能耗和隐含碳排放远低于SSD,这一优势在PB级训练语料库、检查点和长期保留中会不断累积。在AI应用中,HDD非常适合存储原始和预处理后的数据集、数据增强过程中生成的合成数据、用于审计的模型工件以及随时间累积的推理输出。厂商将这种做法描述为:将冷温层保留在磁盘上,仅在需要低延迟时才使用闪存,这与某厂商的指导一致。

闪存为AI工作负载带来的优势

NAND闪存以半导体单元中的电荷形式存储信息。它提供极低的访问延迟和高随机IOPS,适合需要立即响应加速器的模型权重、KV缓存和向量数据库。某厂商概述了这些特性和用例。闪存会因编程/擦除循环而磨损,因此控制器会应用纠错码、磨损均衡和预留空间来分散写入。耐久性通过总写入字节数和每日驱动器写入量等指标进行管理,而工作负载模式至关重要。某技术组织的耐久性白皮书解释了顺序工作负载如何产生较低的写入放大,而随机和写入密集型模式则会提高放大并缩短寿命。该白皮书还记录了NVMe功能,如流、NVM集和分区命名空间,这些功能可减少写入放大并提高耐久性。

训练与推理的实用布局

以下是反映厂商和云指导的端到端流程:将权威训练语料库持久化存储在基于HDD的对象或文件系统中,以实现成本效益高的持久性,如某厂商和某云文档所示。在运行之前,将当前轮次的分片暂存到本地或网络NVMe上。某AI加速器建议使用SSD缓存以避免小文件和网络瓶颈。训练期间,从闪存顺序读取大批次以保持GPU充分供应。根据某云的建议,调整FUSE或客户端设置以实现更大的I/O和批处理,从而提高吞吐量并减少SSD磨损。将检查点和临时工件写入闪存以吸收突发写入,然后在检查点稳定后将其迁移到HDD容量层进行保留,如某加速器指南所述。对于推理,将模型权重、KV缓存和向量索引保留在闪存上以实现低延迟。将推理输出和审计跟踪持久化存储在基于HDD的存储中,这些存储的增长主要由容量驱动。

关键对比

采购成本:HDD每TB约比SSD便宜6倍(某厂商数据),而SSD成本更高。延迟与IOPS:HDD延迟较高,但擅长大规模顺序吞吐;SSD延迟极低,随机IOPS高(某厂商数据)。耐久性管理:HDD无编程擦除磨损;SSD受TBW和DWPD影响,写入放大是关键因素,NVMe流、NVM集和分区命名空间可帮助改善(某技术组织数据)。每TB能耗与隐含碳排放:HDD远低于SSD(某厂商数据)。典型AI用途:HDD用于数据集、静态检查点、推理输出、归档;SSD用于模型权重、KV缓存、向量数据库、突发缓冲区。

管理闪存耐久性与放置

设计者可以通过将软件与介质匹配来安全地将闪存用于热层。某技术组织的耐久性论文表明,写入放大随小随机写入而增加,随大顺序写入而减少。NVMe流、NVM集和分区命名空间等功能使应用程序或文件系统能够对相关数据进行分组并顺序写入,从而减少内部垃圾回收并延长寿命。更新的方法(如灵活数据放置)允许主机控制数据在SSD内部的落点位置,以进一步控制放大。云指导增加了客户端级调优:某云建议在从对象存储服务训练时使用大顺序读取、批处理和缓存大小调整,以保持低磨损和高吞吐量。这些技术使运营商可以将闪存保留给热数据和延迟敏感层,同时依靠HDD作为持久容量层——该层随着推理产生持久输出而持续增长,这一模式与某技术组织的观点一致。

局限、风险与误区

误区一:所有闪存将很快取代HDD。当前运营商的指导恰恰相反。某厂商强调,闪存加深了堆栈,而HDD容量仍然是批量数据集和不断增长的推理输出的经济支柱。误区二:SSD耐久性不是问题。闪存单元每次编程/擦除循环都会磨损,耐久性取决于工作负载,写入放大越高寿命越短。NVMe流、NVM集和分区命名空间可减少放大(某技术组织白皮书)。误区三:HDD速度太慢,不适合AI训练。训练通常受益于大顺序读取。将热子集缓存到NVMe并将数据暂存到SSD可以避免小文件和网络瓶颈,同时将权威数据集保存在基于HDD的存储上(某AI加速器和某云指导)。误区四:能耗总是倾向于闪存。在每TB基础上,某厂商强调HDD的能耗和隐含碳排放低得多。重视延迟或每瓦IOPS的工作负载仍可能将热数据放在闪存上,这就是分层设计存在的原因。误区五:对象存储会成为GPU瓶颈。如果以大量小读取方式访问,确实可能成为瓶颈。云指导建议在缓存前端进行批处理和大顺序I/O,以维持吞吐量并减少SSD磨损(某云指导)。

实际应用场景

如果你正在构建或运行AI工作负载,将在多个地方看到这种拆分:本地训练集群:GPU附近的NVMe或SSD池用于权重、缓存和突发写入,基于HDD的文件或对象存储保存数据集、稳定后的检查点和日志(某加速器指南)。云端管道:基于闪存的缓存或托管的高性能文件系统服务于热路径,而基于HDD的存储桶保存大数据集和长期保留(某云推荐)。向量搜索与检索增强生成:嵌入和向量索引位于闪存上以实现低延迟查询,而底层语料库和生成输出则累积在HDD容量上(与某厂商和某厂商一致)。合规、审计与可重复性:训练检查点和实验工件稳定后,从闪存突发缓冲区移动到基于HDD的保留(某厂商)。

常见问题

全闪存AI数据中心是否可行?对于较小规模或数据集有限的情况可行,但批量经济学和保留需求倾向于HDD。某厂商报告HDD每TB成本比SSD低约6倍,某厂商强调闪存是补充而非取代HDD容量。训练期间哪些数据应放在闪存上?将模型权重、热分片、KV缓存和向量索引放在靠近计算的NVMe或SSD上。将当前轮次暂存到闪存并吸收检查点突发,然后将稳定后的工件迁移到HDD容量(某AI加速器和某厂商指导)。TBW和DWPD与实际工作负载有何关系?它们量化了在SSD达到额定寿命前可以写入的数据量。某技术组织的耐久性论文显示,写入放大导致额定寿命与实际寿命之间存在差距。顺序、较大的写入可降低放大,小随机写入则提高放大。如何减少AI管道中的SSD磨损?顺序写入并使用较大批次,通过NVMe流或NVM集对相关数据进行分组,考虑分区命名空间。客户端调优如批处理和从对象存储进行大顺序读取也有帮助(某技术组织和某云推荐)。为何要将检查点从闪存移到HDD?检查点会产生短时高吞吐写入,闪存能很好地吸收。稳定后,将其移至HDD可释放宝贵的闪存空间用于热数据,并将工件存储在更便宜的容量层,这是某AI加速器最佳实践中记录的做法。

© 版权声明
THE END
喜欢就支持一下吧
分享