具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会深度解析

日期:2026-09-26 17:56:33 / 人气:5


当下AI行业的最大悬念,已经不再是大模型能不能更强,而是谁能长出真正能干实事的机器人大脑。
GPT-6持续迭代、世界模型概念爆火、VLA(视觉语言动作模型)、自进化机器人轮番登场,所有赛道都在争抢具身智能的核心话语权。资本市场更是给出极致溢价:相比纯语言大模型公司,具备具身能力、世界模型布局的企业,估值天花板被普遍看高一线,甚至诞生有望超越OpenAI估值体量的行业新巨头。
但热潮之下,行业虚火与技术迷雾并存。各类概念层层包装,世界模型被反复神化、泛化,真假技术路线混杂,不少Demo惊艳的产品,落地真机后漏洞百出。
在最新一期虎嗅AI100闭门会上,章鱼动力、华映资本、域变换、墨奇智能的四位行业嘉宾,从技术研发、资本逻辑、学术前沿、产业落地四大维度,撕开行业热门概念的伪装,给出了当下具身智能最真实的5大核心判断:不看名词看能力、语言智能替代不了物理智能、真机闭环是唯一标尺、大脑无法脱离身体孤立存在、未来巨头可能来自全新赛道。
01 撕掉“世界模型”滤镜:行业最大误区,是概念大于能力
如今的具身智能赛道,“世界模型”已然成为最高频的流量热词。做视频预测、仿真模拟、动作生成的团队,纷纷将自身技术包装为世界模型,概念边界无限泛化,让从业者、投资人、创业者陷入认知混乱。
针对行业乱象,华映资本海外合伙人邱谆提出了最朴素、最核心的项目判断法则:先把“世界模型”四个字遮住,只看本质能力。
这和多年前“元宇宙”的行业乱象如出一辙:宏大的概念试图覆盖所有场景,最终反而失去了精准的定义与评判标准。褪去概念外衣,有人用世界模型做技术工具,有人将其当作终极目标,赛道语境完全错位,唯有落地能力不会骗人。
章鱼动力世界模型合伙人陈文科给出了底层定义:真正的世界模型,核心是建立AI与物理世界的真实关联,核心能力只有两项——预测物理世界变化、推演时空因果关系。机器人推杯子、调夹爪力度、改变动作姿态,能够提前预判物体位移、状态变化,才是世界模型的核心价值。
南京大学特聘研究员吴昊进一步提炼出三大硬核考核标准,也是机器人大脑的入门底线:能不能预测未来环境变化、预测结果能否指导决策、决策指令能否在真机上完成闭环落地。
换言之,仅能生成炫酷视频、输出精美模拟画面,无法指导真实动作、无法适配真机环境的模型,只是“观赏性技术”,算不上真正的机器人大脑。
复旦大学可信具身智能研究院吴桐补充,当下行业热议的视觉世界模型,主要分为两条技术路线:一是通过视频预测物理状态变化,辅助机器人策略训练;二是依托视觉预测直接生成动作指令。而广义的语言模型,本质也是一种认知层面的世界模型。评判技术优劣的核心,从来不是标签,而是模型到底为机器人大脑新增了哪些落地能力。
02 GPT-6再强,也补不齐物理智能的先天短板
GPT-6的强势迭代,让行业诞生了一个终极疑问:既然大语言模型的推理、记忆、规划能力已经足够强大,能不能直接嫁接机器人,充当通用机器人大脑,彻底替代专用具身模型?
闭门会嘉宾达成统一共识:语言智能可以拔高上限,但无法补齐物理智能的底层短板,机器人大脑不能只靠语言生长。
陈文科用L、V、T三维体系,拆解了机器人大脑的完整架构:L(Language语言)、V(Vision视觉)、T(Tactile触觉)。三者分工明确、缺一不可。语言模型擅长长程规划、逻辑推理、任务拆解,是机器人的“思考中枢”;但真正对接物理世界、完成实操动作,核心依靠视觉与触觉。
人类的绝大多数肢体动作,无需语言中介。伸手抓水杯、调整发力力度、适配物体姿态,都是视觉与触觉的即时反馈,无需大脑进行语言翻译。同理,机器人干活的核心壁垒,从来不是“会不会思考”,而是“能不能感知、能不能适配、能不能精准执行”。
吴桐团队的GPT-6真机测试,直观印证了这一结论。GPT-6展现出极强的指令泛化、上下文学习与长程任务拆解能力,能够精准理解复杂指令、分步完成目标,是顶级的“思考型大脑”。但短板同样致命:
第一,实时性不足。云端大模型推理延迟高,无法适配物理世界毫秒级的即时反馈需求,机器人作业无法随时暂停等待模型思考;
第二,物理感知缺失。一旦摄像头被遮挡、环境光线变化、物体材质改变,GPT-6无法通过触觉、动态感知预判变化,任务成功率大幅下滑。它能理解“要做什么”,却无法预判“做完会发生什么”。
这也确立了行业未来的主流分工模式:大语言模型承担高频、长周期的顶层规划(System 2),VLA、世界动作模型承担低速、即时的实操执行(System 1)。语言能让机器人“想明白”,唯有视觉与触觉构成的物理智能,能让机器人“干得好”。
03 拒绝Demo玄学:预测、决策、真机闭环,是唯一真考题
当下行业多数出圈成果,都停留在精美Demo层面:固定场景、固定光线、固定设备,机器人动作流畅、精准高效。但行业共识是:Demo只能证明“曾经做成过”,无法证明“可以稳定商用”。换一张桌面、换一种材质、微调灯光环境,很多模型就会彻底失效。
真正区分行业噱头与硬核技术的,是三道终极考题:预测精度、决策有效性、真机闭环能力。
吴桐明确了技术评判标准:世界动作模型的核心价值,是在真实环境中稳定、安全、高成功率运行;世界仿真器的核心价值,是能够持续优化后续训练策略、提升真机能力。无法落地优化的仿真、无法闭环执行的决策,均无产业价值。
吴昊进一步指出物理世界的核心特征:开放、长尾、充满不确定性。单纯依靠预训练的模型,永远无法覆盖所有真实场景。机器人大脑的核心竞争力,不在于出厂时的初始能力,而在于进入真实环境后,能否通过自我交互、自我纠错、持续进化。
行业真正的破局思路,是打破“训练完美再落地”的固有思维。模型初始能力40分也可落地,通过人机协同、真实作业、失败复盘,持续采集真实数据,逐步迭代至60分、80分、90分。具身智能的终极优势,是自进化能力——真实场景不仅是落地终端,更是永久训练场。
陈文科补充,模型规模缩放(Scaling)确实能提升动作精度,但前提是数据与基础设施先行。脱离真实数据闭环、基础设施不完善的模型扩容,只是无效堆参数,无法实现能力跃迁。
04 没有悬空的大脑:模型、本体、控制必须协同共生
行业曾流行一种理想化认知:机器人大脑可以像大模型API一样独立存在,通用模型可以适配所有机器人硬件,实现即插即用。
但落地实践彻底推翻了这一观点:越接近真实部署,越没有孤立的大脑。
陈文科直言,纯做大脑、脱离硬件本体的路线走不远。真实机器人作业中,硬件批次误差、执行器损耗、视觉噪声、高频力反馈、动力学偏差,都是无法规避的问题。这些硬件层面的物理瑕疵,不会因为模型智商提升而自动消失。想要真正落地生产力场景,大脑与硬件必须协同设计、深度适配。
吴桐则给出更客观的折中判断:通用认知能力可以跨本体迁移,任务理解、空间认知、行为判断等能力,能够适配不同机械臂、机器人本体。但如果追求自然流畅、稳定可靠的商用级表现,通用大脑必须与专属硬件深度耦合。
这也标志着具身智能彻底告别纯软件模型时代。未来的行业竞争,不再是单一模型能力的比拼,而是模型、控制、本体、传感器、数据、基础设施的综合体系对抗。谁能补齐模型与硬件之间的最后一公里适配差距,谁才能真正跑通商业化闭环。
05 资本高溢价的真相:上限极高,但赛道仍无终局
资本愿意为具身智能给出远超纯大模型赛道的估值溢价,核心源于其独一无二的产业想象空间。如果说大模型重构的是信息世界,具身智能重构的则是实体生产力,是唯一能让AI替代人类体力劳动、介入工业、民生、服务全场景的终极形态。
邱谆总结了资本的核心逻辑:大语言模型已经找到了Coding、办公自动化等高价值高频场景,形成了稳定商业闭环;而具身智能尚未出现专属的“王牌场景”,工厂、物流、家庭、康养均在探索期,但一旦跑通平台级机器人大脑,其商业上限将远超纯信息AI。
当下行业处于典型的“资本提前定价、技术尚未落地”的错位阶段。资本已经按照通用机器人的终局形态给出估值,但行业仍未收敛技术路线、未明确落地场景、未形成成熟商业模式。
与此同时,赛道存在明显过热风险,资本周期的波动会淘汰大量跟风玩家。更关键的是,具身智能的终局玩家充满不确定性。参考NLP赛道,BERT主流多年后,GPT全新范式实现弯道超车。如今具身智能多条路线并行,未来的行业巨头,可能是现有头部玩家,也可能是全新路线的新入局者。
06 行业终极分歧:先做大模型,还是先跑场景?
整场闭门会,行业嘉宾并未给出统一的终极答案,但清晰呈现了当下两条核心技术路线的博弈,也是行业未来数年的核心竞争方向。
路线一:Scaling First(优先做大模型)。陈文科认为,AI产业的终极爆发,源于模型能力的临界点突破。早期LLM商业化受限,核心是模型智商不足;当模型推理、工具调用、自主规划能力跨越阈值后,应用会自然爆发。当下具身智能的核心优先级,是持续做大模型、做强基础能力、等待能力跃迁,场景落地是水到渠成的结果。
路线二:Deployment First(优先落地场景)。吴昊则坚持,通用世界模型难度过高、周期太长,行业无需等待完美模型。当下最优解是落地半结构化场景,先打造“场景专属模型”,吃透单一场景的物理规则、作业逻辑,通过人机协同完成基础作业,在真实交互中积累数据、迭代模型,从垂直场景逐步走向通用。
吴桐给出了中立的第三视角:两条路线并非对立,而是相辅相成。行业真正的未知命题是:通用智能究竟源于海量预训练的模型缩放,还是源于真实场景的持续交互进化?这一问题的答案,将决定未来具身智能的产业格局。
结语:真正的壁垒,是大脑持续在真实世界变强
褪去世界模型、自进化、GPT原生具身等热门概念的包装,具身智能的本质逻辑已然清晰。
语言智能决定机器人的思维高度,物理智能决定机器人的落地下限;模型规模决定技术上限,真实场景闭环决定商业下限。行业不需要更炫酷的Demo、更宏大的概念,需要的是能稳定干活、持续进化、适配实体场景的真能力。
未来能跑出超高估值、超越传统AI巨头的具身智能公司,一定是打通了“模型迭代+硬件适配+场景闭环+自进化学习”的完整链路。
当AI不再只会说话、只会生成内容,真正走进物理世界,替代人类完成劳作、创造价值,属于具身智能的产业爆发期,才会真正到来。
本文基于2026年9月22日虎嗅AI100第12期闭门会直播,观点来自嘉宾本人发言

作者:天辰娱乐




现在致电 5243865 OR 查看更多联系方式 →

天辰娱乐 版权所有