泡泡资讯网

17岁少年贡献KimiK3核心架构技术 【全球最大规模开源模型Kimi K3震动

17岁少年贡献KimiK3核心架构技术 【全球最大规模开源模型Kimi K3震动全球AI圈 深圳17岁少年贡献K3核心架构创意】近日,中国人工智能公司月之暗面发布新一代大模型Kimi K3,总参数规模达2.8万亿,是全球首个接近3万亿参数级别的开源模型。支撑Kimi K3的,是两项关键架构创新,其中一项名为Attention Residuals(AttnRes,注意力残差),核心贡献者之一正是17岁的深圳少年陈广宇。

K3发布后旋即引发全球AI圈高度关注。由加州大学伯克利分校创建的国际AI盲测平台Arena,采用匿名对战和用户盲选机制,K3在其前端代码榜单中以1679分位居第一,超过Claude Fable 5和GPT-5.6 Sol。7月17日,埃隆·马斯克在一份第三方独立评测帖下公开回复“令人印象深刻”。这份评测也认为K3已跻身全球最前沿模型阵营,综合能力可与多款顶尖闭源模型比肩。

AttnRes的技术论文发布于今年3月。当时,深圳特区报记者独家采访陈广宇,确认他来自深圳,是一名在读高中生。论文中,他与月之暗面研究员张宇、苏剑林位列前三,均被标注为同等贡献。

Kimi官方明确表示,K3基于两项关键架构更新构建,分别是Kimi Delta Attention(KDA,混合线性注意力机制)和AttnRes。前者改善信息在更长序列中的流动,后者改善信息在更深模型中的流动,二者共同构成K3扩展至2.8万亿参数规模的架构基础。

AttnRes有多重要,可以用一组数字直观说明:Kimi官方披露,这项技术增加的额外成本不到2%,却带来约25%的训练效率提升。对于参数规模以万亿计的大模型而言,这意味着付出很小的额外计算代价,就能显著提高训练效率。

现有大模型常用的做法,是把前面各层的信息不断向后累积。模型越深,早期形成的有用信息越容易被层层叠加的内容淹没。AttnRes提出了一种新思路:让后面的网络层根据当前输入,从前面不同层中挑选并汇集更有用的信息。

据苏剑林回忆,在AttnRes研究中,陈广宇和张宇共同提出Block AttnRes(分块注意力残差)。它将逐层选择改为分块选择,在保留大部分效果的同时,降低显存占用和通信开销,使AttnRes更适合大规模模型训练,并被推进为项目主线。

K3采用的另一项关键架构是KDA。陈广宇此前参与过KDA底层计算优化,加入Kimi后最早的工作之一便是加速该计算内核。

Kimi官方表示,KDA、AttnRes等结构性改进,再加上训练方法和数据配方的优化,使K3相较上一代K2的整体扩展效率提升约2.5倍,能更有效地把算力转化为模型能力。

K3迅速成为海外AI圈的讨论焦点。盲测平台Arena联合创始人兼首席执行官称其“可能是今年最重大的发布”,此次发布很可能“引发资本市场的重新洗牌”,因为它“动摇了OpenAI、Anthropic等美国闭源模型的主导地位”;卡内基梅隆大学教授、前苹果AI研究负责人Russ Salakhutdinov称其为“开源模型社区的重大胜利”。

K3的发布也迅速影响国际资本市场。彭博社报道称,K3正在冲击华尔街,被视为新的“DeepSeek时刻”,推动市场重新评估全球人工智能竞争格局。

K3发布后,陈广宇在社交媒体写道:“K3是个特别聪明也特别美的模型。”AttnRes论文发布时,他也曾称这篇论文“特别好、特别美”,并感慨:“这可能是一项改变大语言模型历史的工作。”

Kimi官方称,完整模型权重将于7月27日前发布,关于架构、训练和评测的更多细节,将随K3技术报告一同公布。(深圳特区报)