欲了解更多,就来【坚料网】
大陆「月之暗面」旗下的Kimi K3近期宣布释出完整模型权重,与此前推出的DeepSeek-V4形成呼应,中国人工智慧产业不再只是推出另一个性能与模式跟美国比高下的产品,而是挑战人工智能必须依赖美国科技巨头所建立的那套超大规模资本支出、顶级GPU(图形处理器)、封闭模型、高价API(应用程式介面)的模式吗?
△大陆「月之暗面」旗下的Kimi K3近期宣布释出完整模型权重,与此前推出的DeepSeek-V4形成呼应。(新华网图片)
Kimi K3与DeepSeek-V4挑战美国模式
人工智能的演进日新月异,过去的AI主体聊天机器人,使用者提问,模型回答;未来的AI则将转变为Agent,一个AI智能体自主规画、执行与修正工作。聊天机器人只需要回答少少的问题;AI智能体却可能需要阅读数百份文件、呼叫数十次工具、执行多轮推理、撰写程式、测试结果,再根据错误重新修改。AI产业的真正成本,将不再只是训练模型的经费,而是每天、每小时甚至每秒钟,全球企业要消耗多少Token。
△Kimi K3是一个总参数规模达到2.8万亿级的开放权重模型,但透过稀疏化的混合专家模型架构,实际上每次运算只启动其中一小部分专家。
大型语言模型是把文字切分成一个个可以处理的单位,这些单位就是Token。使用AI服务时,企业实际上不是单纯「买一个答案」,而是按照输入与输出的Token数量付费。AI Agent普行后,会使Token使用量急剧增加。一个AI智能体可能必须阅读整份报告;搜寻外部资料;建立资料表;分析数据;提出结论;检查是否存在错误;重新修正答案。这一连串工作可能需要模型进行数十次甚至数百次推理与工具调用。核心问题变成谁能够以最低成本提供足够高的智能?这正是Kimi K3与DeepSeek-V4挑战美国模式的关键所在。
Kimi K3是一个总参数规模达到2.8万亿级的开放权重模型,但透过稀疏化的混合专家模型架构,实际上每次运算只启动其中一小部分专家。所谓「混合专家模型」可以比喻为一间公司有成千上万名专家,但每一个问题只需要其中十来位专家处理。传统模型可能让所有人都同时工作,MoE模型则只挑选少数适合的必要专家,每一次回答问题所需要的实际计算量可大幅降低。这就是AI产业正在发生的根本变化:模型的「总规模」与每次使用的「实际成本」开始脱钩。
△DeepSeek-V4的价值在于试图解决AI产业下一个最大的技术瓶颈:长上下文与智能体的运算效率。
DeepSeek-V4的价值在于试图解决AI产业下一个最大的技术瓶颈:长上下文与智能体的运算效率。DeepSeek-V4目前公开的Pro版本总参数规模达到1.6万亿,但每次实际启动的参数约49B;Flash版本则是284B总参数、13B活跃参数,两者都支援100万Token的上下文长度。简单说,一个AI模型可以一次记住并处理极其庞大的资料量。
一个企业级AI Agent可能需要长时间处理,如果模型每次都必须重新阅读这些资料,成本将非常高。因此,AI产业出现了一个重要的技术问题:如何让模型「记住」大量资讯,而不必每一次都把所有资料重新送进GPU?这涉及所谓的KV Cache,也就是模型在处理长文本时保存的中间记忆。KV Cache越大,需要的GPU记忆体越多。对AI服务商而言,这可能比单纯的模型参数更昂贵。
以最低成本完成最多工作
DeepSeek-V4的技术方向,包括稀疏注意力、Token压缩以及针对长上下文的记忆体优化,实际上是在回答一个非常现实的问题:如何让AI记住更多东西,但消耗更少的记忆体?这个问题将成为Agent时代的核心。因为当AI从「问答工具」变成「数位员工」,AI成本将越来越取决于模型每天实际运作的成本,也就是「谁能以最低成本完成最多工作」。
过去两年,华尔街对人工智慧的投资逻辑是:AI需求增加,所以科技公司要购买更多GPU;GPU越多,就能训练更大的模型;模型越大,AI服务越强;AI服务越强,企业就能收取更高价格。于是,Google、Meta、Microsoft、Amazon等巨头竞相提高资本支出。问题是,一座大型AI资料中心需要购买GPU、伺服器、网路设备、电力设备、冷却系统和土地,往往需要数百亿以上美元。投入如此巨大的资本,未来能产生多少现金流?这就是投资报酬率的问题。
如果AI模型的价格一直很高,巨额投资或许可以回收。但如果开源模型不断把AI价格降下来,企业可以非常低的价格调用API,整个产业的经济模型就会跟着发生变化。
△这是2025年4月29日拍摄的位于上海市徐汇区的人工智慧大模型创新生态社区「模速空间」外景。(新华网图片)
这正是中国模型对矽谷形成的真正威胁:透过更低价格、更开放的权重、更低的推理成本,让更多企业可以使用AI。这种模式可能形成一个完全不同的商业逻辑:美国巨头希望控制最强模型,透过封闭API获取高额收入;中国企业则可能透过开放模型,降低价格,扩大使用者规模,再从云端服务、企业部署、硬体、应用与生态系统中获取收益。
这两种模式的竞争的根本差异,一种模式是少数公司控制昂贵的专有软体,另一种模式则是开放系统快速普及,让大量开发者共同建立生态。如果AI最终走向开放模型主导,那么今天昂贵的模型垄断可能会承受巨大的投资与运营压力。
中国企业改变的不是单一产品,而是一整套复杂的科技生态。美国的科技封锁提高了中国AI发展的阻力,中国力图从「追求单一最强晶片」转向「整体系统效率」。这包括更有效率的模型架构、更好的编译器、更高效的推理、更强的国产晶片、更大规模的本地市场以及开源社群。
这是一种不同的技术路线,也就是用更多元的硬体、更有效率的软体和更大规模的市场,建立另一套可以运转的AI生态。
台湾是否拥有自己的AI模型?
△台湾是全球AI硬体供应链的重要中心,台积电掌握先进制程;台湾企业在先进封装、伺服器、散热、电源管理、PCB与零组件方面具有重要地位。
对台湾而言,这场AI革命发出重大警讯。
台湾是全球AI硬体供应链的重要中心,台积电掌握先进制程;台湾企业在先进封装、伺服器、散热、电源管理、PCB与零组件方面具有重要地位。因此,过去两年AI热潮为台湾带来巨大的出口与投资红利。只要AI继续发展,台湾就一定能够持续获利。问题是,AI产业正在发生变化。
目前的AI竞争主要是谁能够取得最多GPU,未来可能是谁能够用最少的GPU完成最多的工作。如果未来AI模型效率大幅提高,企业就不必像今天一样无限制地购买昂贵硬体,那么整个AI硬体供应链的超额利润就可能受到压力。华尔街最终仍然会回到最基本的问题:这些AI资料中心究竟能产生多少自由现金流?如果资本支出成长速度远远超过AI收入成长速度,投资者就会开始重新评估AI产业的估值。因此,台湾不能只关心台积电接到多少订单,也不能只关心伺服器出口增加多少。
更重要的是:台湾是否拥有自己的AI模型?是否拥有自己的AI软体平台?是否拥有自己的Agent生态?是否拥有能够将AI导入制造业、金融业、医疗、教育与政府服务的应用能力?
如果答案是否定的,那么台湾可能只是在全球AI产业中扮演「高级制造商」。而高级制造商虽然可以赚钱,却未必拥有真正的定价权。
台湾应成为「AI技术与应用生态的参与者」
△中国AI证明人工智能的发展,不一定只有「无限增加资本支出、购买更多GPU、训练更大的封闭模型」。另一条道路可能就是AI从少数巨头的昂贵技术,变成全球企业普遍使用的基础设施。AI产业的价值链就会重新分配。
Kimi K3与DeepSeek-V4的真正意义,不在于中国AI是否已经全面超越美国。美国仍然拥有最强大的资本市场、顶尖晶片设计能力、先进制程、云端平台以及全球最成熟的AI研究生态。但中国AI证明人工智能的发展,不一定只有「无限增加资本支出、购买更多GPU、训练更大的封闭模型」。另一条道路可能就是AI从少数巨头的昂贵技术,变成全球企业普遍使用的基础设施。AI产业的价值链就会重新分配。
未来真正具有竞争力的企业,不一定是拥有最多GPU的企业,而是能够用最少的算力完成最多工作的企业。
台湾拥有全球最重要的AI硬体优势,但硬体优势不是AI革命的终点。如果台湾只把自己定位为全球AI产业的制造基地,那么当模型效率提高、硬体成本下降、AI服务价格崩跌时,台湾的超额利润也可能随之受到压力。台湾真正的战略目标,应该是从「AI硬体供应商」进一步成为「AI技术与应用生态的参与者」。
文:陈国祥
政治大学新闻系、新闻研究所硕士,台湾资深媒体人,曾任中央通讯社董事长、中央选举委员会委员、《自立晚报》总编辑、《中国时报》总编辑、《中时晚报》社长、台北市政府客家事务委员会委员、《中国时报》特约主笔、时报育才董事长。现为传媒顾问。
*作者文章观点,不代表坚料网立场