Skip to content

0721|中国Kimi K3 为何吓崩MG科技G(卢克文)

82
2026-07-21

上周,美国科技股突然崩盘。

从今年 6 月高点到 7 月中旬,海力士跌了 43%,三星跌 34%,闪迪跌 35%,甚至连英伟达也跌了 12%,上周跌得尤其猛,这么血淋淋的场面,真的是好久没见了。

这里面虽然有宏观因素,但外媒披露了一个重要信息。

上周美股暴跌的一个重要因素,是因为中国公司发布了一款新的大模型 Kimi K3,因为性能强大,一下子把华尔街吓到了,导致美股盘中暴跌,摩根大通将其称之为 "DeepSeek2.0 时刻"。

那么 Kimi K3 为啥有这么大的威力,让整个华尔街都感到如此震动呢?

月之暗面发布 Kimi K3 的时间很巧妙,7 月 16 日,就在中国人工智能大会的前一天,不知道是不是打算给美国同行一个小小的震撼呢?

K3 的纸面数据达到 2.8 万亿参数,在 K3 出来之前,大家公认最强的开源模型是 DeepSeek-V4-Pro,参数量是 1.6 万亿,K3 提升了 75%,接近翻倍,当之无愧成为目前全球参数最大的开源模

型。

参数对于大模型最终性能极其重要, 就像人脑里的神经元, 参数越大, 理论上就越聪明。

但是参数大也有问题,这么大的模型跑起来,需要多大的算力?又怎么对全球用户提供服务?

K3 采用了两项新技术,算是暂时解决了模型效率问题。

第一个技术叫作 KDA 混合线性注意力机制。

这个概念很晦涩,我们可以简单解释一下:

过去的大模型,处理长文本的时候总是会得 "健忘症",给它塞了一百本书进去,它读到最后面,就把最前面的细节给忘了,因为传统的注意力机制越往深处走,信息损耗就越大,"忘" 得就越多。

就算你标榜你能实现百万上下文,结果后面出来的内容都是错的,又有啥意义呢?

而 K3 搞的这个 KDA,思路是让模型像人读书一样,带着一个不断更新的记忆往下读,读到哪更新到哪。这样不仅百万上下文真正有了意义,推理速度也提升到了原来的 6.3 倍!

第二个技术,是优化了 MoE(混合专家模型) 的稀疏度。

K3 内部集成了 896 个专家网络,你可以把它理解为一个超级大医院,里面有 896 个专家。

过去病人来看病,需要把 896 个医生都叫过来看,这要消耗多少人力 (算力)?

为了优化效率,很多大模型一般都会根据你的病情,只激活其中最对口的 16 个专家,其他专家继续睡觉,以此节省资源,DeepSeek-V4-Pro 也是这么玩的。

但难就难在,专家越稀疏,训练越容易崩,896 个医生的医院,每次只叫起来 16 个人,怎么保证任务分得均匀、没人闲死没人累死?

K3 为此结合自研的 Stable LatentMoE 框架,用分位数均衡替代传统的专家均衡策略,再配上自研的激活函数控制,终于实现了在超大参数规模下的可控算力消耗,使 K3 的扩展效率达到了 K2 的 2.5 倍。

目前在 Arena 大模型排行榜上,虽然 K3 距离 ClaudeFable5 和 GPT-5.6Sol 还差一点,但已经超过了其他所有模型,目前是全球第三、开源第一。

而在 ArenaAI 前端代码竞技排行榜上,K3 更以
1679 分登顶全球第一,超过 Claude Fable 5 的
1631 分和 GPT-5.6 Sol 的 1618 分!

在品牌营销、参考设计、数据分析、消费产品、模拟、内容创作、游戏七大细分方向中,K3 拿下六个第一,仅游戏类排名稍落后于 Claude Fable 5。

这太吓人了。

在这之前,行业普遍认为开源模型和闭源模型之间,存在 1.5-2 年的代差,K3 的问世,直接把两种模型的差距拉到了几个月。

在发布 K3 的同时,月之暗面还放出了三个演示。

第一个演示,K3 在连续 48 小时的无人干预运行中,用开源 EDA 工具和 Nangate45 纳米工艺库,独立完成了一颗芯片的设计和仿真。

第二个演示,K3 从零写出一个 GPU 编译器,直接对标英伟达主导的行业标准工具 Triton。

第三个演示,月之暗面搭了个沙箱,让模型在 24 小时内持续优化底层的 GPU 内核,结果 K3 把自家 AttnRes 内核的运行时间从 283.6 毫秒压到 114.4 毫秒!

这意味着什么? 意味着大模型开始参与制造自己的模型了!

我们一直又担心又期待 AI 能够实现自我进化和迭代,但现在,我们真正亲眼见证了这一幕。

如果说之前的大模型迭代,还依赖工程师一点一点摸索,那么未来的迭代速度,已经不取决于有多少工程师了,而是取决于谁有足够的算力和电了。

当然,目前这些还只是概念验证 Demo 阶段,没有商业化,我们还有一段路要走。

2

一年半前,DeepSeek 横空出世,英伟达单日蒸发近 6000 亿美元市值,创下美股历史纪录。

美东时间 7 月 17 日,也就是 Kimi K3 发布当天,费城半导体 (SOX) 盘中暴跌超 5%,K3 发布后 72 小时,美股 AI+ 半导体产业链总市值蒸发 4700 亿美元。

但 K3 对美国大模型带来的冲击,可能比 DeepSeek 还要大。

当年 DeepSeek 问世时,美国人还能自我安慰,DeepSeek 再厉害,也只是个 "穷人的 GPT",高端市场还是我们的。

就在 K3 发布之前,Anthropic 高管刚刚放话,Claude 大约领先中国对手 6 到 12 个月。

这就是硅谷的心态:中国会追,但追不上,优

势在我!

结果 K3 问世后,Arena 评测平台联合创始人伊恩·斯托卡马上做出了判断:“现在,他们可能只落后 2 到 3 个月。”

也就是说,万一美国因为停电或者罢工之类的意外事件,导致训练暂停一段时间的话,可能就要被中国人追上了。

而且这是中国公司拿着被阉割的二流 GPU 搞出来的成果,如果把美国的先进 AI 芯片给中国,谁知道会诞生什么怪物?

现在中美 AI 竞争就像两个人在赛跑,美国人看到中国人追得只剩 100 米了,就找了个小弟去抱住中国人的腿,试图拖慢中国人追赶的速度,又跑了一阵,美国人觉得肯定把中国人甩没影了,结果回头一看,中国人距离自己只有 20 米了!

如果中国人把抱腿的小弟甩开 (突破 GPU),会发生什么?

更大的冲击,在于钱。

过去三年,美国 AI 企业其实讲的都是同一个故事:智能等于算力,算力等于投资,所以谁烧钱多谁就赢。

英伟达四万亿美元的市值,就是建在这个故事

之上,所有公司都在拼命向股东解释花钱的重要性,别怕我们烧钱,烧得越多,模型越厉害。

但现在 K3 把这个故事给推翻了:月之暗面这个估值 315 亿美元的公司,居然搞出了个估值万亿美元公司才能搞出来的东西。

目前我们还不知道训练 K3 花了多少钱,但行业测算,K3 全链路投入约 6 亿美元,而 GPT-5、GPT-5.6Sol 全链路投入约 15-20 亿美元,Fable5 约 22-26 亿美元!

三分之一到四分之一的成本,做出 95% 的性能,你让美国的 AI 公司怎么给股东解释?甚至,美国大模型公司原先那套商业模式,可能也玩不下去了。

OpenAI 和 Anthropic 的商业模式,其实就是四个字:唯我独有,你想用模型闭源只能租,按量付费。

Claude 最火爆的时候,顶级模型的输出价一度卖到每百万 token 几十美元,简直是躺着挣钱。

这种玩法能玩得下去,原因只有一个:闭源模型真的比开源模型强很多。

也许个人用户会嫌贵,但对初创公司和开发企业来说,闭源模型确实好用,虽然贵,但

也节省了一大笔人工费。

但现在 K3 把这个稀缺性给干没了。性能追到顶级模型的 95%,每百万 token 只要 15 美元,不到 Fable5(50 美元) 的三分之一。而按 Axios 的对比,K3 在 Area 榜上评分不但高过 0pus4.8,价格还低 40%。

你要是企业 CEO,董事会现在问你:为什么我们要为那 5% 的差距,付三倍的钱?你怎么回答?

最后也是最重要的一点,全球 AI 生态可能会因此改变。

过去,第三世界国家没有 AI 能力,要么不用 AI,要么用美国 AI,但用美国 AI 的代价是数据有泄漏风险。

现在月之暗面宣布。K3 的完整模型权重将在 7 月 27 日前向全世界公开。

也就是说,从那天起,地球上任何一个人,都可以把 K3 下载到自己电脑上(当然,这需要你的电脑配置非常非常强),自己部署和微调,不用花一分钱买 token,而且数据全程封闭,绝对安全。

这是有史以来第一次,全球各国的开发者,可以无条件且不受任何美国条款约束地获得全球顶级水平的人工智能,大家不仅可以免费用,而且完全拥有数据主权,医疗、金融、军事等

敏感数据可以留在国内。这对美国大模型主导的生态,是多么大的挑战?

就在 K3 发布的同一天,美国智库圈流出一份报告,标题就叫《面对中国强力竞争,为什么美国必须主导开源人工智能》。

报告传达出一层意思: 谁掌握了全球开发者的技术底座, 谁就拥有 AI 时代的主动权。

这很容易理解,服务器里跑的是中国模型,那搞出来的应用、形成的标准,也要适配中国模型。

这种情况只要持续五年以上,美国将丧失全世界的 AI 生态。

中国公司发力开源大模型是阳谋。美国没法破。

美国不是没有开源模型,但因为缺乏资金反哺,Meta 和 Llama 都已经掉队。

OpenAI 迫于压力拿出来的开源模型 GPT-OSS. 跟自家旗舰版的差距很大,没人愿意用,也撑不起生态。

客观来说,闭源有闭源的优势,但美国的问题在于太依赖闭源了,未来要搞出更强大的 AI 模型,只有为英伟达支付更多溢价,把更多真金白银拿去买两三年就过时的 GPU。

现在的中美 AI 竞赛,让我想起当年的美苏太空竞赛。

1957 年斯普特尼克上天,1961 年加加林入轨,苏联人看起来事事抢先,但每一步美国都紧紧跟上,结果苏联人把更多的资源砸进航天这个无底洞,把家底烧空了,最后分崩离析。

虽然今天的中美 AI 竞赛不能简单对号入座,但有一点是相通的:竞赛的胜负,从来不取决于谁暂时领先,而取决于谁能笑到最后。

美国一个模型的训练成本以亿美元计,中国以百万美元计,这场仗一旦打成消耗战,到底对谁有利呢?也许,看起来事事抢先的那个,未必是最后的胜利者。

  • 0

评论