科技与自然
·
cnBeta/DeepTech深科技/每日经济新闻
·
2026-07-21 14:16

美国财长:若证实中国蒸馏美国技术或将制裁 月之暗面否认蒸馏

美国财政部长斯科特·贝森特于周二表示,特朗普政府将对中国的人工智能模型是否通过蒸馏技术从美国模型中获取成果展开调查,并强调美国政府绝不支持知识产权盗窃行为。

当前,中国开源模型在性能上正逐步追赶OpenAI和Anthropic等美国领先企业的核心产品,这引发了美国技术高管及政府官员对于美国在人工智能全球竞赛中领先地位能否持久的担忧。本月初,中国初创公司月之暗面发布了名为Kimi K3的新模型,该模型在部分行业基准测试中的表现已超越了上述美国公司的产品。

贝森特在接受福克斯商业频道采访时指出,如果发现海外模型在窃取美国优秀企业的成果,美方完全有能力针对这种盗窃行为实施制裁。

贝森特解释称,这种行为在技术上被称为“模型蒸馏”,即利用现有更强模型的输出结果来训练构建一个体积更小、能力稍逊的模型。上个月,Anthropic曾向美国参议院银行、住房和城市事务委员会致信,指控中国科技企业阿里巴巴实施了迄今为止规模最大的蒸馏攻击。

根据路透社周二的报道,美中两国计划于今年9月就人工智能议题举行相关会谈,届时贝森特将代表美方出席讨论。

贝森特在采访中表示,美方在许多中国模型中发现了美国大型语言模型的数字水印,这是令人无法接受的,美方将在未来几天或几周内对此进行深入调查。

不过,Anthropic与OpenAI近年来自身也面临过类似的版权侵权指控。去年9月,Anthropic同意支付15亿美元,以和解一群作家提起的集体诉讼,这些作家指控该公司非法下载并使用盗版数据库中的书籍进行训练。《纽约时报》也曾在2023年起诉OpenAI及微软,指控其未经授权使用该报的知识产权来训练AI模型。

Kimi K3火了,月之暗面回应争议:并非蒸馏复刻现有模型,国产AI不该被贴上低价标签!知情人士:其估值可能超300亿美元

Kimi K3发布后的第四日,风暴仍在持续。

4天前(7月17日)凌晨,2.8万亿参数的K3横空出世,以1679分登顶Frontend Code Arena榜单,首次有开源模型在Frontend Code Arena前端编程榜单超越一众闭源模型登顶。特斯拉CEO(首席执行官)埃隆·马斯克在相关评测下留言:“Impressive(令人印象深刻)。”这是马斯克继今年3月点赞Kimi底层架构技术报告后第二次公开认可这支中国团队,并在其预告新模型Grok 4.6时,甚至将Kimi K3作为对比目标。

而赞誉的另一面是风暴。发布48小时后,Kimi发文表示用户请求量已大幅超出其预估,并且逼近现有集群的承载极限,Kimi宣布暂停C端新用户订阅,有业内观点将此次事件类比为“DeepSeek 2.0时刻”。

与此同时质疑声起,一方面有外界流传K3蒸馏模型的言论;另一方面人工智能公司OpenAI战略未来负责人迪恩·鲍尔也公开发帖抨击Kimi K3模型。他一方面承认K3性能无法依靠蒸馏实现,另一方面表示开放权重模型会削弱前沿模型的商业回报,称其为“减速主义力量”。

技术原创性争议、开源闭源路线之辩、高定价策略的可持续性,三重追问投向月之暗面公司,该公司企业业务负责人黄震昕直面媒体,首度系统性回应外界质疑。

否认“K3是蒸馏小模型”

“性能跃升来自底层原创架构创新”

针对外界流传的“K3是蒸馏小模型”的猜测,7月21日上午,月之暗面公司企业业务负责人黄震昕在接受媒体记者采访时直接否认。黄震昕表示,K3性能跃升的核心来自底层原创架构创新,并非对现有模型蒸馏复刻。

此前发布时,Kimi也提到架构层面变化带来的效率提升。据介绍,Kimi K3基于Kimi Delta Attention(KDA)混合线性注意力机制和Attention Residuals(AttnRes)注意力残差技术构建。MoE(混合专家)层面,模型在896个专家中激活16个。而上述结构性改进让Kimi K3 相比K2的整体扩展效率提升约2.5倍。

本次黄震昕进一步披露了支撑K3的三项关键技术。其中,Moon Clip是一种全新二阶优化器,由Kimi首次应用于大模型训练。“当前全球可用训练数据基本见底,这项技术能让20T训练数据跑出40T的训练效果,同等性能下训练成本、算力功耗直接减半。”Kimi Linear Tension是其自研线性注意力机制,用于解决传统线性注意力处理超长任务时性能衰减的痛点。“行业存在AI摩尔定律,AI可执行任务时长每7个月翻1倍;这套机制让上下文窗口扩大10倍,训练成本仅同步扩大10倍。”

今年3月发布技术报告时已引起过一次关注的Attention Residuals(注意力残差),这项技术优化了模型多层网络间信息传递与复用逻辑,它让2.8万亿超大参数模型既能稳定完成训练,又能让推理效率同步提升25%。

今年以来,月之暗面创始人杨植麟曾多次在公开演讲中提及Kimi构建规模化策略Token(词元)效率、长上下文、Agent(智能体)集群,在有限资源下实现智能最大化。而从当前Kimi技术迭代方向来看,团队仍坚定不移地走既定路线,专注编程、金融、法律、科学研究等生产力场景。

关于模型幻觉问题,黄震昕也作出了回应。他表示,幻觉无法彻底根除。“幻觉本质是模型创造力的同源产物”,但K3已大幅压低其发生率;配套事实校验员子Agent的Agent Swarm架构,可逐一对报告、行业数据做校验,进一步降低内容失真概率。

面对开源闭源路线之争,黄震昕的观点清晰:二者并非对立竞争关系,而是企业客户差异化需求的产物。有私有化、微调需求的企业倾向开源,追求稳定托管服务的企业选择闭源。开源、闭源路线本身,与模型Token能力、输出质量没有必然绑定关系。

他同时明确,Kimi自K2起坚持开源路线,这一路线未来不会改变,核心底层技术、论文均对外公开,完整模型权重计划于2026年7月27日前发布。

用户请求量大幅超出预估

算力承压的Kimi要做取舍

K3上线的火爆程度超出所有人的预判,包括月之暗面。黄震昕坦言团队提前做了流量预案,但实际访问量的暴涨幅度远超预期。

发布后48个小时,Kimi在7月19日深夜紧急发布公告,表示其面临始料未及的算力挑战,用户请求量已大幅超出预估,并且逼近现有集群的承载极限。

黄震昕表示,当时公司面临两难,放开全部新用户注册,会严重损害存量付费老用户的使用体验;优先保障付费客户,则需临时限制新用户注册。公司选择了后者。“宁可暂时放弃新增收入,也要守住付费客户的使用体验底线。”

7月19日,月之暗面正式公告暂停C端新用户订阅,将已有算力全部投入服务已订阅用户,同时全速推进算力扩容。在新算力陆续到位,再逐步开放更多订阅名额直至全面恢复正常订阅。根据Kimi官方回复内容,目前老套餐没有被移除,当前用户可正常使用并自动续费;老用户可选择升级套餐。

《每日经济新闻》记者也就算力扩容落地时间规划、新增算力的规模等问题向公司方面发出提纲,但截至发稿暂无回应。

对于商业化层面,黄震昕透露,Kimi现阶段暂不提供私有化部署服务,商业模式对标海外成熟头部AI企业,核心发力打磨模型基础能力。他同时也表示不会止步于当前2.8万亿规模,大模型参数规模还会持续拓展。

本次随着模型能力一同受到关注的还有一路走高的模型价格。据第三方机构Artificial Analysis测算,Kimi K3单任务成本约0.94美元,与GPT-5.6 Sol的1.04美元接近,约为Claude Opus 4.8(1.80美元)的一半,定价已经将K3推向与海外头部模型同台竞技的价格带。“开源模型、中国大模型不该被贴上低价标签。我们做出了SOTA(State-Of-The-Art,最先进水平)级模型,也能匹配合理商业定价。”黄震昕说。

数据也成为这一观点的印证。此前7月18日,月之暗面总裁张予彤在社交媒体发布一张Kimi企业最新ARR(年化收入)的图表,图片显示Kimi K3于7月17日发布后,企业ARR有了数倍快速增长。

图片来源:张予彤小红书账号截图

《每日经济新闻》记者了解到,此前6月中旬,月之暗面的ARR已经突破3亿美元。

同一时间,黄震昕在公开演讲中表示,Kimi海外付费用户增长400%,API收入增长400%,产品进入200多个国家和地区,互联网、金融、制造、教育、医疗等行业正成为重要企业客户来源。

他也在谈及大模型行业发展现状时表示,当前赛道确实存在发展泡沫。黄震昕同时举例,海外头部厂商Anthropic已实现季度盈利,月之暗面也正向着这一方向赶超,“最终还是希望探索智能的上限,希望能和海外那3家模型公司掰掰手腕”。

风暴眼中,另一条消息也在发酵。据市场知情人士向《每日经济新闻》记者透露,头部大模型企业月之暗面已向投资人发送上市议案,预计最快6个月内有望完成港交所上市,估值可能超过300亿美元。目前公司方面对此暂无回应。

月之暗面创始人杨植麟,图片来源:每经媒资库,资料图

K3引发的连锁反应远未结束,中国大模型正在全球市场成为新的价值标杆。7月18日,马斯克宣布xAI正在训练参数规模达2万亿的Grok 4.6,“将在下周完成首轮训练,有可能超越Kimi。”月之暗面随后在社交媒体上回应:“欢迎加入“2万亿+”俱乐部。”本次黄震昕也表示:“可能这次的这个(K3)表现,(让他们)得到一点震撼的感觉,现在拭目以待,希望他们出来跟我们掰一掰手腕。”

当开源模型第一次站到编程能力的世界之巅,并向海外头部闭源产品的价格带看齐时,真正的考验才刚刚开始。撕掉“低价”标签之后,如何在开源的开放姿态与商业的合理回报之间找到平衡,让SOTA级的技术能力兑换成可持续的定价权,还需要Kimi和所有中国开源玩家不断探索。

延伸阅读:K3发布不到一周,美国封禁外国开源AI模型的呼声再起

《为什么硅谷总忍不住回头看中国》(Why Silicon Valley Can’t Stop Looking Over Its Shoulder at China),是《纽约时报》在当地时间 7 月 20 日的一篇报道标题,配图用的是刚刚在上海举办的世界人工智能大会的现场照片。

同一天,据美国新闻媒体 Axios 报道,美国政府正在酝酿一项重大政策转向,针对 Kimi K3 等中国开源 AI 模型的崛起势头,特朗普政府部分官员正拟议针对外国开源 AI 模型实施禁令。这项举措假如最终落地,将在很大程度上巩固 OpenAI 和 Anthropic 等美国头部 AI 企业的行业主导地位,但也会切断美国开发者获取高性能、低成本 AI 替代方案的渠道。

大约一周前,中国 AI 公司月之暗面发布了 Kimi K3,这是一个参数量达到 2.8 万亿的 MOE 模型,在多个权威评测中其表现仅次于 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol,目前位列全球第三。更为关键的是它的权重将在 7 月 27 日开放,届时任何人和任何公司都可以免费下载、部署和定制这个几乎触及全球最高水平的大模型。发布后不久,特斯拉 CEO 马斯克便在一则相关评测报道下留言“令人印象深刻(Impressive)”,这是他继今年 3 月点赞 Kimi 底层架构技术报告后,第二次公开认可该团队。

但是,美国政府对于这件事的看法和华尔街不完全一样。

Axios 的报道揭示了过去一年美国白宫内部围绕中国开源模型的激烈争论。2025 年夏季,美国商务部就曾考虑将多家中国 AI 公司列入实体清单,最终因种种原因暂时被搁置。美国国家安全局和白宫网络总监办公室也考虑过发布针对中国 AI 公司威胁的警告,以从商业层面劝阻美国公司使用中国技术。白宫还曾考虑过这样一项行政令,要求美国公司只有在“对安全负责的前提下”才可以托管中国模型。之前所有这些提案最终都被否决了,但是随着 Kimi K3 的发布,去年的这些讨论开始重新升温。

白宫前 AI 顾问 David Sacks 在社交媒体上直言,他说美国领先的闭源 AI 公司已经形成了事实上的双寡头格局,它们在 AI 模型的收入上占据主导地位,而现在它们想要美国政府帮它们消灭开源 AI 竞争对手。

Sacks 所指的闭源实验室正是 OpenAI 和 Anthropic,这两家公司通过筹集数百亿美元,建造了大规模 AI 数据中心,训练了目前全球最好的 AI 模型。然而,它们的商业模式存在一个共同点,即通过 API 按 Token 收费,每百万 Token 的价格大约在 4 美元。相比之下,来自中国的 Kimi K3 通过开放权重让用户可以免费下载模型,用户还可以在自己的服务器上运行,推理成本远远低于闭源 API。

这可能会直接威胁到了闭源 AI 公司的利润,OpenAI 战略事务负责人 Dean Ball 在一篇引发广泛讨论的 X 推文中指出了这一点,他认为开源模型本质上是减速主义的,并认为会抑制 AI 领域的进一步资本支出。他还认为这种情况最终可能导致“完全的 AI 公有化”,让 AI 变成一种由国家提供的公共基础设施,而不再是市场化的商品,在他的眼中这种未来是反乌托邦的。

但是,他的观点遭到了多方反驳。针对该帖子网友热评之一称:“你对这个话题的看法真是太糟糕了,令人惊讶竟然出自你口。”Hugging Face 首席执行官 Clem Delangue 指出,限制开源 AI 模型不会让 AI 更安全,只会把风险隐藏起来,让权力仅集中在少数人手里。图灵奖得主 Yann LeCun 和 a16z 合伙人 Martin Casado 等科技界人物也公开表示反对,认为 AI 开源软件能够加速创新。看到自己的观点被质疑,Ball 后来收回了关于监管打压是政府最佳策略的说法。

如果你经常在 X 浏览 AI 讯息,你会发现这几天 X 上有不少外国人关于 Kimi K3 的讨论。全球 AI 评测平台 Arena 联合创始人 Anastasios Angelopoulos 认为 Kimi K3 的发布可能是 2026 年最重要的 AI 模型发布。在代码前端等一些特定任务上,Kimi K3 甚至超越了美国的 AI 竞品模型,他认为中国 AI 公司正在从追赶者变成并行者。

事实上,早在 2025 年美国开发者已经开始用脚投票。a16z 合伙人 Martin Casado 在观察自家投资组合时发现了这样一个趋势,当前硅谷相当一部分 AI 初创公司使用的核心模型正是来自中国的开源模型,他在一档播客中透露这个比例可能高达 80%。

在全球众包 AI 评测平台 Design Arena 的开源模型排行榜单上,前 16 名模型全部被中国模型占据。在 AI 模型聚合与路由平台 OpenRouter 上,最受欢迎的 10 个 AI 模型中有 6 个使用了中国技术。此前亦有在美国的中国留学生告诉 DeepTech,由于项目预算有限,他和所在团队用不起美国头部模型,后来转用国内某模型省了不少钱并顺利完成项目。

对于那些没有稳定现金流的美国初创公司来说,选择开源中国模型是一个成本计算题。通过 API 调用闭源 AI 模型意味着每一次交互都会产生成本。开源模型则可以部署在本地,不仅推理成本可控,还可以对模型进行微调,从而打造出来能够贴合特定需求的产品,并且不需要把敏感数据上传到第三方云服务。

然而,这个选择在大企业那里就变得不一样了。美国风险投资公司 Menlo Ventures 的数据显示,2025 年上半年全世界范围内的企业在生成式 AI 上花了 84 亿美元,其中 OpenAI 和 Anthropic 两家占据多达 57% 的销售份额,也就是说中国开源模型虽然“很香”,但其在企业市场中的存在感要远远低于在开发者社区中的热度。

大型企业的决策逻辑和开发者有着天然不同,前者更加关注安全性、技术支持、服务等级协议和法律责任的明确性,而这些正是闭源 AI 供应商的优势所在。就算一个开源模型在技术上表现优异,企业如果真的采用它,仍然需要自行承担部署、维护和风险管理的全部责任。

美国政府的政策困境恰恰就在这里:假如禁止外国开源模型,就会打击大量依赖低成本 AI 能力的本土初创公司和开发者们;假如不禁止,OpenAI 和 Anthropic 的闭源商业模型就会受到持续挤压,这两家公司在筹集数百亿美元以用于下一代模型训练上的动力也会减弱。

这种矛盾在美国芯片出口管制上表现得更为明显,美国乔治城大学安全与新兴技术中心研究员 Sam Bresnick 指出,真正能够延缓中国 AI 发展的方式是加强芯片出口管制,禁止开源模型并不是最佳方法。但是,众所周知的是特朗普政府此前已经放宽了部分管制,允许英伟达向中国销售更多芯片,前提是美国政府要从中分一杯羹。

在上周的世界人工智能大会上,中国明确承诺将中国 AI 生态的未来建立在开源和全球传播的基础上。这个表态恰逢 Kimi K3 发布不久,这让外界看到了中国在 AI 竞赛中的路径选择。

Kimi K3 的发布还带来了一个让人意想不到的问题,由于需求太过于旺盛,月之暗面不得不暂停新的订阅。而回顾这几年来,从 DeepSeek 到 Qwen 再到 Kimi K3,中国 AI 公司都在用同一种方式扩大影响力,这种方式的特点便是开放权重、免费使用、性能逼近顶尖水平。

而这场围绕闭源开源的争论将直接决定未来几年 AI 产业的走向,闭源模式的优点在于能够集中资源推动前沿突破,但是成本高昂只有少数公司负担得起,开源模式的优点在于能够实现技术的快速扩散和低成本应用,然而谁来承担训练下一代前沿模型的巨额投入是一个问题。

当前的格局是,美国拥有最好的闭源模型和最雄厚的资本,中国拥有最具竞争力的开源模型和极高的成本效率。中间夹着美国数百万开发者和初创公司,它们目前正在用脚投票。假如美国政府决定封禁外国开源模型,这个平衡就会被打破,届时美国 AI 产业将只剩下两个寡头,竞争和创新都有可能受到抑制。

在《麻省理工科技评论》盘点的 2026 年 AI 趋势里,曾提到中国开源策略在全球开发者生态中产生的深远影响,Kimi K3 发布后美股市场的波动与订阅的暂停,让全球开发者社区对中国开源模型的热情从一个抽象概念变成一个具体的公共事件。它可能代表着中国 AI 公司以开源换生态的战略已越过萌芽期,进入了收获市场真实反馈的秋收阶段。

用户发布内容分享,若违规侵权,请联系我们核实删除

User-generated content. For violations or DMCA, contact us for removal

收藏 礼物
评论列表 查看 2 条评论