文|机械最前线
“大脑”正在取代“身体”,成为具身智能行业新的竞争焦点。
根据统计数据,2026年上半年国内具身智能赛道总融资额达437.66亿元,其中以具身大脑为核心业务的“大脑派”公司融资222.53亿元,占比高达50.8%;而以机器人本体整机为核心的“本体派”公司同期融资仅56亿元,占比12.8%。
一级市场的资本风向,清晰地指向了这一变化。而这种转向并非没有缘由,宇树的机器人可以在舞台上后空翻,智元的机械臂能在实验室里拧螺丝,但面对传送带上微微偏移的包裹、货架上被顾客挪动过的商品,甚至是一扇透明的玻璃门,这些看似灵巧的“身体”的表现常常大打折扣。
硬件越做越强,真实场景却越“跑”越吃力。行业用两年时间完成了本体能力的快速迭代,却在不经意间撞上了一堵更厚的“墙”。
2023年初春,一则消息的出现引起了整个科技圈的震动。
3月,OpenAI发布了多模态预训练大模型GPT-4,与此前的版本相比,GPT-4具备强大的识图能力,文字输入限制也提升至2.5万字;回答准确性也显著提升,还能够生成歌词、创意文本从而实现风格变化。
不少公司和行业开始面临被大模型重塑的“命运”。Figure AI,这家获得微软、英伟达和OpenAI巨额投资的独角兽也不例外。
考虑到与其死磕从零训练,不如将通用大模型的认知能力与机器人本体深度结合。2024年初,Figure AI与OpenAI达成合作协议,后者为其提供先进的语言模型支持,帮助机器人实现对话、推理和规划等功能。
这个决策逻辑在当时几乎无可指摘,毕竟,互联网已经训练出了能够理解复杂语义的模型,为什么不直接拿来用。
所以,此后很长一段时间里,这条“拿来主义路线”成为行业主流,也就是用面向数字内容创作的视频生成模型做底座,再通过微调适配机器人。
Physical Intelligence的π系列、英伟达的GR00T N1.7、Google的Gemini Robotics,以及国内绝大多数具身智能团队,都在用通用大模型做底座。
这套方法论的优势显而易见,研发周期短、可复用现成的多模态能力,并且在实验室和标准化的演示场景中表现亮眼,但问题在机器人进入真实环境时开始暴露。
物流仓库的传送带速度会有细微波动;药房货架上的药品包装并非完全统一;工厂车间里的光照条件随时变化……这些在人类看来微不足道的差异,却足以让通过迁移学习逐步适配机器人任务的模型失效。
根本原因在于,将原本用于理解世界的模型改造为可以执行任务的机器人大脑,它的训练目标本质上仍然围绕预测下一帧或者理解语义,而机器人需要回答的核心问题是“我的动作会让世界发生什么改变”。
前者捕捉相关性,后者需要建立因果关系,两者之间存在结构性错配。
更深层的矛盾在于数据的获取,大模型可以吞噬互联网上万亿级的文本和图片,但机器人没有属于自己的互联网。
真实物理世界的交互数据只能依靠遥操作一帧一帧采集,成本高昂、效率低下。截至2026年初,全球合规、可用的真实物理交互数据总量仅约50万小时,不足大语言模型训练数据的两万分之一,缺口超过99%。正是这些矛盾的叠加,最终催生了行业对底层架构、数据和预训练目标的重新审视。
当“大脑”成为具身智能的决胜点,各路玩家正在用不同的方式争夺这个位置。从当前格局来看,大致可以归为三类。
第一类是海外大模型公司,它们试图打造跨本体、跨任务的通用大脑。
比如Skild AI主要聚焦通用世界模型研发,核心能力是让机器人在真实物理环境中实现零样本任务泛化;Physical Intelligence则走VLA路线,凭借海量真机数据在跨本体泛化上建立了壁垒……这些公司的共同特征是押注“一个模型通吃”的通用路线。
第二类是科技巨头,它们致力于做机器人时代的基础设施,是最接近“底层平台”的公司。
比如英伟达推出的Isaac GR00T,被官方定义为面向通用人形机器人的开放参考平台;Google DeepMind发布的Gemini Robotics,依托多模态大模型的理解能力,试图用互联网知识补足机器人常识;华为则选择不做本体而专注做行业的技术底座,推出了CloudRobo具身智能开发平台,定位一站式公共开发工具链……
第三类是国内的一些具身智能公司,它们的路径更加多元。
逐际动力提出了“模型只是技能,系统才是真大脑”的观点,发布具身大脑系统LimX COSA 0.5,把认知、技能和运控拆成三层;自变量机器人则走端到端路线,其WALL-A模型采用端到端VLA操作大模型架构,与世界模型深度融合,实现具身多模态思维链……
而大脑赛道内部的分化同样剧烈,据“创业最前线”报道,VLA(视觉-语言-动作)模型一口吃掉了42%的资金,世界模型占27%,数据基础设施占20%,端侧芯片占11%。
VLA路线继承视觉语言模型的语义理解能力,把观察、语言和动作直接连接起来,成熟、直接、离真实落地更近,因此成为行业主流。
不过,随着越来越多人发现,VA路线把视频预测、世界模型引入机器人控制,把未来场景演化作为动作生成的一部分,这个“后来者”开始获得越来越多关注。
两条路线各有拥趸,而真正值得关注的,是那些试图跳出两派之争、从更底层重新思考问题的玩家,蚂蚁灵波便是其中之一。
作为蚂蚁集团面向具身智能与机器人产业设立的核心业务载体,其在2026年7月7日—10日一口气发布六款模型,构成其“全栈大脑2.0”体系,并将在一周内密集开源。其中,首个具身原生世界动作模型LingBot-VA 2.0模型的发布,标志着机器人基础模型正式从“基于数字世界模型构建”到“面向物理世界原生设计”的关键转变。

(LingBot-World 2.0,图源:蚂蚁灵波官方网站)
蚂蚁灵波的核心主张是“具身原生”,这种做法的与众不同之处在于,它拒绝把通用大模型当作现成的脑袋接上一具身体,而是从物理世界的运行规律出发,重新设计了感知、推演和执行三个环节的底层逻辑。
技术好不好,落地场景最有说服力。在工业物流场景,蚂蚁灵波与乐聚合作,将VLA2.0部署到物流分拣产线;在零售医药场景,蚂蚁灵波与国大药房合作落地人机协同药房方案;在硬件产品化场景,蚂蚁灵波与奥比中光合作,将自身的视觉感知能力与深度相机硬件结合,推出更适合机器人场景的深度感知产品……如今LingBot-VLA 2.0 已经适配17家厂商、20余种构型,单臂、双臂、双足和轮式都能覆盖。

(图源:蚂蚁灵波)
尽管蚂蚁灵波首席科学家沈宇军也坦承道,VLA是当前更容易落地的主流路线,VA/WAM补上了动态建模和未来预测;但未来不会是“VA或者VLA的天下”,而会出现一个“1+12”的新模型。
可是无论如何,“具身原生”所代表的从物理世界出发重新设计的思路,正在成为行业讨论中一个无法绕过的参照系。
技术路线之争最终要在真实场景中接受检验。
2025年中国具身智能市场规模已达9150亿元,同比增长20.4%,分析师预测2026年将进一步增长至10904亿元。具身智能产业化的“元年”已至的声音,一时之间甚嚣尘上。
不过,这个“元年”背后,一台人形机器人的硬件采购成本动辄数十万元,绝大多数服务场景难以在合理周期内收回投入。再加上,在复杂的真实物理世界中,缺乏高质量数据支撑的机器人往往难以实现“好用”,这个产业化“答卷”并不好写。
并且,由于不同机器人本体之间差异巨大,单台机型需要工程师定制调试一套专属算法,换一台机器人、换一套场景就要重新训练适配,非标开发成本居高不下。截至目前,各家要么有脑无身、有身无脑,真正具备“跨本体适配能力”的玩家,屈指可数。
如果换一种身体就要重新训练一套模型,换一个场景就要重新部署一次,这种碎片化的开发模式无疑是具身智能规模化落地最大的隐性成本。
此外,具身智能行业仍处于早期阶段,智元联合创始人、总裁兼首席技术官彭志辉在WAIC 2026上也表示:“目前,行业对具身大脑的技术路径尚未收敛,两三年可能就会出现新架构,很难预判技术的唯一答案。”
跨本体的长期稳定性、开源生态能否形成可持续的正向循环、真实场景数据的规模和质量是否足以支撑模型的持续进化,或许还需要更长时间的验证。
但资本市场的信号已经足够清晰,大脑派公司的融资节奏快到平均一个月一轮,甚至有企业两轮融资间隔只有两周。
资本的涌入本身也意味着,这个赛道正在以极高的溢价抢夺人才和数据。接下来的竞争,将不再是谁先发布模型,而是谁能真正解决数据从哪里来、模型如何在不同场景低成本迁移、这些更具体也更艰难的问题。
总而言之,如今具身智能正在经历一个从炫技到干活的艰难转身。过去两年,行业的兴奋点集中在“能不能做出来”,接下来的五年,真正的考验是“能不能用起来”。
而资本正在用真金白银投票给大脑而不是身体,这本身已经说明行业对瓶颈在哪里的集体判断。这条路的终点还远未可见,但方向已经清晰,接下来的问题,只是谁先走通。