我宣布,Kimi 正式 和 DeepSeek 一桌,成了开源界的真·活菩萨。


cp-emoji-014 因为昨天晚上,Kimi K3 正式在 Hugging Face 上开源了。

图片


 半小时就在 Hugging Face 里拿下 4000 赞,可以说是有史以来最被人关注的开源模型了,估计是有不少老外和差评君一样掐点等着。

图片


cp-emoji-049 而且 Kimi 这次开的东西也不简单,除了模型的权重文件本身之外,还附带了一份详细的技术报告,带上了不少训练模型的工具一块发出来。

图片


这下是和 DeepSeek 一样,是真把焚诀给差友们掏出来了。


cp-emoji-061 各种跑分测试就不多说了,基本上各项跑分都只低于 Fable 5 和 GPT-5.6 Sol。


可以说现在的 K3,就是世界第三的模型,而且是 TOP 3 里你唯一一个可以下载到本地自己运行,自己微调的模型。

图片


而且本身自带多模态功能,没有啥短板。


cp-emoji-158 模型的参数也是比更大还更大,这次 K3 的模型总参数直接给干到了 2.8T,成为了最大的开源模型。


而且不光总参数大,模型的激活参数也是大的离谱,

图片


cp-emoji-154 在实际干活的时候,K3 能够直接激活 1042 亿的参数,这个数量是自己上一代的三倍,是 DeepSeek V4 Pro 的两倍,甚至已经比很多开源的模型本体都要大了。


为了驾驭这个夸张的数据量,这次的 K3 做了很多架构上的创新,当然,人也没藏私,直接都放在文档里光明正大的写出来了。

图片


cp-emoji-193 首先就是大家都关注的注意力方面,传统的注意力机制大家都知道,模型每读一个新词,就需要把它和前面的所有 token 都计算一遍,这样读进去的内容增长一倍,算力开销直接增长了四倍。


而 Kimi 这次为了节省算力,采用了一种叫做混合注意力的办法,信息过来,首先要过一层 KDA ( Kimi Delta Attention ),KDA 会一边读取文本,一边把关键信息写进一个持续更新的状态里。


cp-emoji-235 新的内容进来之后,它还会判断哪些旧信息需要保留,哪些可以慢慢忘掉。


同时为了防止 KDA 漏掉关键信息,Kimi 还在三层 KDA 后安排了个 Gated MLA,相当于是让模型做了几页笔记后,再回头翻下原文检查一下。

图片


通过这套组合拳,K3 大幅度降低了超长上下文的计算成本。

图片


除此之外,Kimi 还设计了 Attention Residuals 注意力残差连接,来减少信息在传递时的丢失。


cp-emoji-198 又设计了 Stable LatentMoE,把原本 7168 维的信息先压缩到 3584 维,再同时派给 16 个专家处理。


还给这些专家安排了限流和排班机制,压住异常激活值,合理分配任务。


避免有人天天 996,有人天天摸鱼的情况发生。


cp-emoji-197 通过这些架构,数据和训练方法的共同升级,K3 在总参数变大的情况下,模型的训练效率,反而比上一代的 K2 提升了 2.5 倍。

图片


而 Kimi K3 的发布和开源,也已经不是技术小圈子的自嗨了。


cp-emoji-233 它像是个导火索,把各路好人坏人、牛鬼蛇神都炸出来了。


比如有美国的政客,就指控 K3 是蒸馏美国大模型整出来的。


Kimi 的员工也漂亮反讽,说 Fable 也才发没多久布,Kimi 几十天的时间蒸馏出一个模型,可以申请吉尼斯世界纪录了。  难不成中国人人均超能力,蒸馏了 Anthropic 未来准备发布的模型?

图片


我懂了,Kimi 发明了时光机,逆转时空到的开始蒸馏 Fable,Kimi 怎么这么坏啊。。。


cp-emoji-250 另外,美国政府在前不久,也准备制裁调查咱国家的人工智能企业。


咱们的商务部也是完美还击。

图片


cp-emoji-186 另外一边,高情商的老黄也注册 X ,发了公开信阐述开源的重要性,还拉了微软、谷歌、OpenAI 等等近快 100 家科技巨头联名。


公开反对封禁中国的开源模型。

图片


cp-emoji-027 压力之下,坚定的闭源主义战士 Anthropic 则又又又发了小作文,说哎呀,我们不抵制开源,只是怕强大的模型落在坏人的手里。


说实话,这次,开源模型能这么快的逼近这些世界顶级的闭源模型,还是蛮让人意外的。。。


差评君还记得第一次看到 Mythos 和 Fable 时的样子,虽然 Anthropic 这家公司天天不干好事,但是人做的模型确实是有两把刷子。

图片


cp-emoji-058 在那个时候,大家普遍以为开源模型和闭源模型的差距会越来越大。


因为这两个类模型在进行的,是一场完全不对等的赛跑。


闭源模型可以随意的学习开源模型的技术,就比如 DeepSeek 就曾经一把屎一把尿的教会了大家,如何让模型学会推理思考。


cp-emoji-035 可是反过来,开源模型却不能从闭源模型那边学到些什么。


但好在,开源模型和开源模型之间,还是有不少互相学习、互相抬轿子的机会的。


翻开这次 Kimi 的论文就会发现,它的眼里都是 DeepSeek 的影子。

图片


cp-emoji-053 从多头注意力 MLA、混合专家模型 MoE,到训练稳定性和推理效率,很多技术里,都藏着开源社区过去几年的积累。


但 Kimi 也没有简单照抄,而是在这些基础上,继续做出了 KDA、Gated MLA、AttnRes 和 Stable LatentMoE 这些新东西。


cp-emoji-094 开源社区里的这股互相学习,互相致敬的风气,才是开源模型最宝贵的东西。


上一代模型留下的经验,会直接变成下一代模型的起点。


这些开源模型就这样互相借力,一层一层地往上搭,硬生生追上了那些掌握着更多算力、资金和数据的闭源巨头。


cp-emoji-096 感谢这些开源模型持续不断的努力,至少现在 K3 发布后,已经没人会说 “ 开源模型会越来越落后 ” 这样的爆论了。


而 AI 的发展,也已经不再是公司与公司、开源与闭源之间的冲突了。它不仅和技术平权相关,还和国家安全、地缘政治等等都脱不开关系。


也希望未来,国内有越来越多像 K3 这样的优秀模型。


毕竟讲道理当然有用,但很多时候,摆实力更好使。



欢迎留言