Kimi K3引发算力逻辑讨论 市场先是恐慌,觉得线性注意力机制要干翻算力需求了,半导体股直接砸了一轮。结果一拆解,2.8万亿参数的模型,仅权重就要占超过1.5TB的HBM,单个GPU根本塞不下。更关键的是,K3为了优化效率,搞了个WideEP技术,把896个专家分散到不同GPU上,单卡显存压力是降了,但专家之间的数据交换反而更吃网络带宽了。官方透露K3最佳推理环境至少需要64颗芯片组成的大型机架算力域,64卡起步才能跑,属于越高效越烧钱。
最讽刺的是月之暗面自己算力都不够用,K3发布后48小时内用户请求量直接逼近集群承载极限,被迫暂停C端新用户订阅。这不就是杰文斯悖论最生动的现场教学吗——效率越高、用的人越多,算力总盘子只会更大。高盛的“算力扩张时代终结”论调刚出来,就被自家算力不够用的事实直接打脸了。
别指望一个架构就把英伟达干趴下,也别一看到算法效率提升就喊着“算力要崩”——更高效的模型只会让更多人用上AI,而更多人用AI,只会让算力更不够用。

