月之暗面发布 Kimi K3,2.8 万亿参数,是首个计划开源的 3T 级别模型,原生支持视觉输入和 100 万 token 上下文。架构上引入 Kimi Delta Attention 和 Stable LatentMoE,896 个专家每次激活 16 个,效率比 K2 提升 2.5 倍,还用 MXFP4 量化感知训练降低部署门槛。
点评:开源模型的参数规模第一次摸到 3T 这个量级,标志着开放阵营和闭源旗舰的差距进一步收窄,官方也坦承整体还略逊于 Claude Fable 5 和 GPT 5.6。真正值得关注的是 KDA 加线性注意力这套组合在 100 万上下文下的推理成本控制,这决定了它在大规模推理场景下的实用性。