我宣布,Kimi 正式 和 DeepSeek 一桌,成了开源界的真·活菩萨。


cp-emoji-014 因为昨天晚上,Kimi K3 正式在 Hugging Face 上开源了。

图片


 半小时就在 Hugging Face 里拿下 4000 赞,可以说是有史以来最被人关注的开源模型了,估计是有不少老外和差评君一样掐点等着。

图片


cp-emoji-049 而且 Kimi 这次开的东西也不简单,除了模型的权重文件本身之外,还附带了一份详细的技术报告,带上了不少训练模型的工具一块发出来。

图片


这下是和 DeepSeek 一样,是真把焚诀给差友们掏出来了。


cp-emoji-061 各种跑分测试就不多说了,基本上各项跑分都只低于 Fable 5 和 GPT-5.6 Sol。


可以说现在的 K3,就是世界第三的模型,而且是 TOP 3 里你唯一一个可以下载到本地自己运行,自己微调的模型。

图片


而且本身自带多模态功能,没有啥短板。


cp-emoji-158 模型的参数也是比更大还更大,这次 K3 的模型总参数直接给干到了 2.8T,成为了最大的开源模型。


而且不光总参数大,模型的激活参数也是大的离谱,

图片


cp-emoji-154 在实际干活的时候,K3 能够直接激活 1042 亿的参数,这个数量是自己上一代的三倍,是 DeepSeek V4 Pro 的两倍,甚至已经比很多开源的模型本体都要大了。


为了驾驭这个夸张的数据量,这次的 K3 做了很多架构上的创新,当然,人也没藏私,直接都放在文档里光明正大的写出来了。

图片


cp-emoji-193 首先就是大家都关注的注意力方面,传统的注意力机制大家都知道,模型每读一个新词,就需要把它和前面的所有 token 都计算一遍,这样读进去的内容增长一倍,算力开销直接增长了四倍。


而 Kimi 这次为了节省算力,采用了一种叫做混合注意力的办法,信息过来,首先要过一层 KDA ( Kimi Delta Attention ),KDA 会一边读取文本,一边把关键信息写进一个持续更新的状态里。


cp-emoji-235 新的内容进来之后,它还会判断哪些旧信息需要保留,哪些可以慢慢忘掉。


同时为了防止 KDA 漏掉关键信息,Kimi 还在三层 KDA 后安排了个 Gated MLA,相当于是让模型做了几页笔记后,再回头翻下原文检查一下。

图片


通过这套组合拳,K3 大幅度降低了超长上下文的计算成本。

图片


除此之外,Kimi 还设计了 Attention Residuals 注意力残差连接,来减少信息在传递时的丢失。


cp-emoji-198 又设计了 Stable LatentMoE,把原本 7168 维的信息先压缩到 3584 维,再同时派给 16 个专家处理。


还给这些专家安排了限流和排班机制,压住异常激活值,合理分配任务。


避免有人天天 996,有人天天摸鱼的情况发生。


cp-emoji-197 通过这些架构,数据和训练方法的共同升级,K3 在总参数变大的情况下,模型的训练效率,反而比上一代的 K2 提升了 2.5 倍。

图片


而 Kimi K3 的发布和开源,也已经不是技术小圈子的自嗨了。


cp-emoji-233 它像是个导火索,把各路好人坏人、牛鬼蛇神都炸出来了。


比如有美国的政客,就指控 K3 是蒸馏美国大模型整出来的。


Kimi 的员工也漂亮反讽,说 Fable 也才发没多久布,Kimi 几十天的时间蒸馏出一个模型,可以申请吉尼斯世界纪录了。  难不成中国人人均超能力,蒸馏了 Anthropic 未来准备发布的模型?

图片


我懂了,Kimi 发明了时光机,逆转时空到的开始蒸馏 Fable,Kimi 怎么这么坏啊。。。


欢迎留言

1 条评论