在最新一期的「商业访谈录」学习播客特辑中,主持人张小珺邀请了清华大学计算机系的博士候选人、上海创智学院璞锐学者孙宇涛,深入解读Kimi K3技术报告。孙宇涛的研究方向集中在大语言模型的架构及其预训练,基于自己在线性注意力、混合注意力和循环增强模型的研究经历,他详细解析了RetNet、Gated DeltaNet、Kimi Linear、Gated MLA、Hyper-Connections、LatentMoE、Muon、Quantile Balancing、WSD、RNoPE、Kimi K1.5/K2.5、MiniLLM以及DeepSeek-V3等多项相关研究,勾勒出技术的演变脉络。
其中,大模型K3的混合注意力设计是此次讨论的重点之一。孙宇涛解释道,Kimi Delta Attention将原有的标量衰减发展为基于通道的细粒度衰减,以此显著提升能力,同时通过lower-bound设计确保BF16数值精度与高效的内核实现。此外,Gated MLA的门控技术也增强了训练的稳定性,而Attention Residuals与Hyper-Connections为残差连接开辟了新的维度。
在节目中,孙宇涛作出了一个关键判断:在3:1的线性注意力与全注意力的混合下,模型能够实现无损甚至更好的长期上下文性能,并在推理效率上取得显著改进。他指出:“人们会发现,在保持一定的全注意力基础上,整个模型能够达到无损甚至更优的长上下文表现。”
K3还采用了2.8T参数的MoE架构。孙宇涛认为,模型参数的规模依然是实现智能的重要因素,他分析了K3在参数数量、激活参数和百万级上下文三个维度的同步扩展,展现了有效的扩展能力。报告中还详细讨论了Scaling Law、WSD调度与RNoPE的长期上下文扩展,同时提到Stable LatentMoE在降低通信开销方面的表现,以及Quantile Balancing实现的专家负载均衡。
在优化器方面,Muon优化器及其对离群值的控制方法也得到了重点提及。孙宇涛指出:“任何优化器都必然会遇到离群值,因此对方法的严密控制都必须从模型架构入手。”
后训练章节中,介绍了K3的多教师on-policy蒸馏、部署感知后的训练以及Draft Model的微调策略。K3通过学生生成样本的on-policy蒸馏,结合部分回滚和推理努力预算控制等多种强化学习技术,优化了训练效率和推理成本。基础设施部分则涉及KDA内核、DualPipe通信隐蔽、动态专家分配、多模态编码器的优化与推理侧的缓存管理。
在节目的最后,讨论转向K3较K2的战略演变及架构创新的哲学界限。孙宇涛以“忒修斯之船”作为比喻,分析了其中的复杂性,并提出了一个被他称为“激进论”的观点:“我的看法比较激进,我认为大模型可能没有实质性的创新,未来可能更多是围绕改良性进步。”他认为,像K3这样的前沿模型是行业共同努力的结果,未来的方向将主要集中在现有技术的改进上,而不是真正的架构变革。商业化进程则取决于任务的明确性。