Kimi K3 在 SGLang 的技术支持与架构解析

#Kimi K3 在 SGLang 的技术支持与架构解析

#内容摘要

本文是对 Kimi K3 模型在 SGLang 框架下进行 Day-0 适配的专业技术解析,详细阐述了架构设计、系统优化策略及性能表现。Kimi K3 是一个 2.8 万亿参数的 MoE 模型,每个 token 激活参数约为 1040 亿个,原生支持 100 万 token 上下文。模型包含 93 层,其中 69 层采用 KDA 线性注意力,24 层采用门控全局 MLA 机制,并利用 Attention Residual 技术将残差流批量处理,减少了深度层间的信息混合。在推理速度提升方面,经过包括内核融合、启动复制消除及推测性解码(DSpark)在内的多级优化,单批次解码速度从基线 44.3 tok/s 提升至 112.5 tok/s,最终达到 423 tok/s。

SGLang 针对 K3 混合架构设计了统一的内存管理与并行策略。由于 KDA 状态是固定大小的递归矩阵(约 54MB 每请求),而 MLA KV 缓存随上下文增长,系统采用了统一内存池方案,动态分配两种区域。在内存优化方面,针对 KDA 不支持传统前缀缓存的问题,引入了 Read-Only checkpoint 与 Copy-on-Write 机制,确保共享状态不被并发请求污染。在并行计算上,预填充阶段采用分片流水线并行(Chunked PP8),通过流水线槽位利用减少了通信阻塞;解码阶段对 MLA 层应用解码上下文并行(DCP),将 KV 缓存按 Token 位置条带分配,有效扩展了逻辑上下文容量。此外,LatentMoE 机制采用共享专家在潜在空间计算,进一步降低了 16 路分发带宽。实测显示,系统总吞吐量可达 2808 tok/s,单用户速度超过 18 tok/s,实现了高参数模型在大规模集群上的高效推理。

#关键要点

  • Kimi K3 模型通过 KDA 与 MLA 混合注意力机制实现了 2.8T 参数与 1M token 上下文的高效推理。
  • SGLang 通过在 TP8 架构下实施分块预填充与解码上下文并行,显著降低了通信延迟。
  • 统一内存池与 RadixAttention 引用机制解决了 KDA 固定状态与 MLA 增长缓存的内存分配冲突。
  • 结合 DSpark 推测性解码与通信融合优化,解码首字节吞吐速度从基线提升 154% 至 423 tok/s。
  • 使用 Copy-on-Write 快照机制保护 KDA 状态共享完整性,避免并发写入损坏前置上下文。
  • LMSYS 测试验证了该系统在长上下文场景下的逻辑容量扩展能力达到约 7.9 倍。
  • 架构设计将残差流分块管理,Layer 93 并没有依赖单一草稿路径,提升梯度与信息传播效率。

#主要话题

  • 大语言模型架构
  • SGLang 推理优化
  • 内存管理策略
  • 并行计算技术
  • MoE 模型加速

#文章信息

  • 作者:Yichi Zhang / SGLang 团队
  • 发布时间:2026-07-27
  • 来源:SGLang Blog
  • 类型:技术博客

原文地址:https://www.sglang.io/blog/kimi-k3-day0-support