2026-08-20 · waytomilky
8 月 5-6 日 FMS 2026,铠侠(Kioxia)拿了"Best of Show"专业存储类别大奖。获奖产品是 GP1 系列超高 IOPS SSD——业界第一款为 GPU 直连场景优化的 SSD。

"GPU 直连 SSD" 是什么意思
传统 SSD 通过 PCIe 跟 CPU 通信,CPU 再把数据转给 GPU。这个路径有两个问题:
- CPU 成了瓶颈(数据搬运工)
- 延迟增加(多一跳)
GP1 走的路线是 GPU 直连(GPU-direct)——SSD 直接挂到 GPU 的 PCIe 通道上,绕过 CPU。铠侠的设计目标是 1 亿 IOPS(每秒 1 亿次读写操作),用第二代 XL-FLASH 实现。
XL-FLASH 是铠侠的低延迟 NAND 技术,对标三星的 Z-NAND。跟普通 NAND 比:
- 普通 3D NAND 单元 cell 大、读延迟微秒级
- XL-FLASH 单 cell SLC 模式,延迟降到十几微秒
- 配合更宽的接口和并行度,IOPS 提一个数量级以上
这对 AI 工作站意味着什么
GP1 这种"超高 IOPS + GPU 直连"的产品,主要解决的是 AI 推理的实时数据加载 场景。
具体来说:
- 大模型权重快速加载:模型 100GB 起步,从传统 SSD 加载要几秒到十几秒,GP1 这种硬件可以把加载压到亚秒级
- 实时特征工程:推荐系统、风控模型需要从存储里频繁取实时特征
- RAG 检索增强:向量数据库放 GP1,LLM 实时取 embedding
铠侠把这个定位叫"用闪存层扩展 HBM"——和 HBF(上一篇文章)目标类似,但走的是 SSD 形态路线。两者不冲突:
- HBF 是新存储介质(OCP 标准化中)
- GP1 是现有 SSD 形态的极限性能
关键数字
FMS 2026 公布的关键规格:
- 1 亿 IOPS(目标值,工程样片级别)
- 第二代 XL-FLASH(单 cell SLC)
- GPU 直连(PCIe Gen5 通道)
- 低延迟:相对传统 NVMe SSD 降低一个数量级
- "Best of Show" 专业存储类别
跟消费者/站长的距离
这是企业级硬件,离 DIY 装机还远。但要理解两个趋势:
1. GPU 不再只跟 HBM 协作。未来你会看到 GPU ↔ HBM、HBF、GP1 三层存储各自负责不同延迟/容量段的设计。这跟经典 CPU 体系里的 L1/L2/L3/主存/磁盘 是一回事。 2. AI 推理的"存储墙"在被逐步拆解。HBM 容量贵是 AI 落地的硬约束,HBF 和 GP1 都是用 NAND 层去做容量补充。不同的实现路径,看谁先跑到能买到的产品。
我自己的判断
1. 1 亿 IOPS 是工程样片数字。量产产品大概率会调整到 50M-80M IOPS 区间,但仍然是 NVMe SSD 主流水平(普通企业级 SSD 是几十万 IOPS)的 10 倍以上。 2. 铠侠押 GPU 直连是赌一个未来:未来 AI 服务器存储拓扑会更"专",而不是通用 NVMe 配 GPU。 3. 实际部署效果取决于软件栈是否优化到位。硬件到软件生态要 1-2 年才能稳定。
局限
- 量产时间表没公布
- 跟 HBF 的关系:互补 vs 竞争,铠侠的策略是同时做 HBF 联盟和 GP1
- 企业级价格不会便宜
小结
铠侠 GP1 是 FMS 2026 上最直观的产品突破。HBM 太贵、SSD 太慢,GP1 用现有 NAND 工艺把延迟压到接近 HBM 的水平。对站长和 AI 开发者来说,现在不用买,但要意识到 AI 推理的硬件栈正在快速重新分层。
评论交流
发表评论