神译局作为36氪旗下编译团队,专注于科技、商业、职场及生活等领域的报道,重点引入国外的新技术、新理念和新趋势。
编者按:别再盲目追求大模型了!物理AI落地的关键在于模型不够聪明,而是传统的工程验证流程。如果集成与测试效率不提升,再顶尖的AI也只能停留在实验室阶段。本文源自编译。
未来十年,数十亿台机器将实现自主化或智能化。从轿车、卡车、拖拉机、矿用运输车,到国防系统、仓储机器人以及人形机器人——整个物理经济体系都将围绕能感知、决策和行动的软件进行重塑。
目前,业界普遍认为实现这一目标的路径大致如下:模型持续进化,世界模型日益成熟,机器人领域的基础大模型应运而生,最终自然催生自主性。智能是这场竞争的全部;只要扩大智能规模,机器的自主化便会水到渠成。
过去十年,我一直在协助Applied Intuition构建众多全球最具雄心的物理AI项目背后的软件基础设施,涵盖软件定义汽车、自动驾驶卡车、工程机械、采矿系统、国防平台及机器人技术。这一经历使我得以在前排近距离观察行业何处加速,又何处受阻。我和所有人一样看好智能发展,但普遍假设在计算逻辑上存在错误。实际部署的物理AI是两个变量的乘积:一是模型本身的能力,二是围绕模型构建的工程系统的吞吐与承载能力——即需求如何转化为软件,软件如何验证,以及经过验证的系统如何部署、监控和持续改进。行业几乎将所有资源都倾注于第一个变量,而第二个变量仍停留在十年前的水平,专为季度发布和数百人的集成团队设计。在前沿智能上运行传统工程系统无法产出前沿成果,因为老旧的工程系统本身才是最大的瓶颈。
因此,这个反共识的押注并非否定智能本身,而是认为物理AI的下一个数量级飞跃,将来自让工程系统变得与其承载的模型一样智能。然而,行业当前的技术路线图仍基于几个曾经合理、但已无法匹配物理AI前进方向的假设。
一个能力出色的模型与一台通过认证且稳定运行的机器之间差距巨大,仅靠提升模型质量无法弥补。一个在基准测试中表现提升20%的模型,仍需与其他许多软件组件集成,在数百万个衍生场景中测试,对照安全需求溯源,在硬件上验证,随后分发至车队或机队,并在真实场地中实时监控。在典型项目中,决定研发节奏的是这条管线,而非模型本身。团队拿到性能有实质突破的模型后,往往需要花两个季度去证明它足够安全、可以发布。
这就是为什么世界模型固然引人注目,但单靠它们无法带我们走向完全自主的未来。模型演进的速度已超出工程研发组织的吸收能力。模型能力的每一次飞跃,只是转移了瓶颈,而非消除瓶颈。限制因素不断向下游推移:从“机器能否感知世界?”演变为“我们能否验证、集成并运维机器现在所具备的能力?”如果团队的验证周期长达数月,这实质上就是将前沿AI的运行速度拖慢到自身流程的水平。
这是整个行业尚未充分计算的一个推论:随着模型在前沿水平上日益商品化,两家拥有相同智能水平的公司将面临截然不同的结局。两者之间的差距,取决于各自的工程系统能以多快速度消化和吸收模型的能力。智能正在变得无处不在,但将其实现工程化落地运维的能力却并非如此。
第二个假设更为微妙:即数字领域正在发生的智能体(Agent)革命会自动延伸至物理AI。只要将代码Agent和Copilot投入到自主驾驶技术栈中,就能带来同样的生产力提升。
事实并非如此,因为大多数数字AI仅止步于文档、对话和代码。而物理AI的工作场景并不在此,它存在于驾驶日志与传感器数据中、仿真运行与有硬件在环路(HIL)的测试机架中,以及需求数据库与验证报告中;它存在于真实道路和工作场地上传输的舰队遥测数据流中。一个从未见过接管(Disengagement)事件、不理解感知退化(Perception Regression)为何至关重要、也无法将需求追溯到测试用例的Agent,在这个领域里绝非生产力工具,而是一个披着友好界面外套的隐患。
让Agent在部署物理AI的过程中具备真正的实战能力,本身就是一个前沿智能课题,这与训练更大的模型截然不同。Agent需要通过足够可靠、值得信赖的接口,直接访问行业核心的数据与工具——如仿真器、数据管线和验证系统。它们需要内嵌领域专业判断力,并积累深厚的行业知识,懂得当交付物装载进数吨重的机器时,“通过验证”到底意味着什么。此外,它们还必须内置评估与治理机制,因为在这个领域,“看似合理的答案”与“真正正确的答案”之间但凡有一点偏差,就可能导致致命后果。
当我说物理AI需要属于自己的Agent平台时,我指的是一个能够将最先进的模型深度植入物理系统的底层数据、工具链和领域经验,并原生集成评估与治理能力的平台。它不是简单挂载在工程工具上的聊天机器人,也不是通过微调通用Agent就能获得的产物。这是一种全新的架构,它对AI创新的要求丝毫不亚于模型本身。
物理AI的未来不仅仅取决于最聪明的模型,更取决于能够将智能大规模转化为自主机器的工程系统。
在探讨物理AI研发中的Agent能力时,人们反射性的反对意见通常是:Agent不应该应用于安全至关重要的工程领域。自动化意味着追求速度,而这可能导致出错。当所讨论的对象重达数吨时,这种担忧无疑是合情合理的。
然而,在安全攸关的系统中,反馈回路的速度本身就是一种安全保障机制。当验证需要数周时,团队只能在不定期的里程碑节点进行测试;而当验证缩短至数分钟时,每次代码变更都会触发测试。问题得以更早浮出水面,此时修复成本极低。覆盖率也得以拓展至成百上千倍的丰富场景中。需求被执行得更加精准,验证频率也显著提升。表面上看缓慢且谨慎的流程,本质上并不一定最安全——它往往意味着缺陷在被发现前,已经在暗处隐蔽地潜伏了数月之久。
在这个领域内,真正能让Agent保持安全的方式并不是降低它们的速度,而是确立清晰的权责边界。将开发、验证与运维的工作流自动化,从而让安全攸关的问题得以更快解决;同时,坚决不对认证、法规签署和最终的工程决策进行自动化。在关键节点上,由Agent提出方案,最终由人类做出决策。任何触及生产系统的操作都必须在审批关卡之后运行。这并非模型改进过程中的临时妥协,而是物理AI应当采用的长期正确架构,就如同一辆设计良好的自动驾驶汽车拥有明确的运行设计域(ODD),而非无限的控制权限。
当Agent能够助力更快速地构建物理AI时,这种开发速度反而能让最终的产品更加安全。
当意识到这些假设正在阻碍物理AI的发展时,逻辑上的下一步就是将更强大的智能与更快速的学习相结合,打造一个由前沿模型与前沿工程系统相互滋养的Agent飞轮。
一个持续运转的飞轮大致如下:机器在实际运行中表现不佳,Agent挖掘运维数据以找出问题所在及原因,或者合成能够暴露该缺陷的特定场景;分析结论转化为研发需求,需求再转化为测试用例;测试用例演变为经验证的软件,随后部署至机器群;机器群产生新的数据,进而提升模型能力,模型能力又反哺Agent的表现,从而加快下一次循环的转动。过去,每一次循环都需要数月时间和满屋子的专家参与。Agent所加速的每一个阶段不仅节省了时间,更增加了飞轮转动的频次,而每一次转动都在对速度与智能进行复利叠加。更聪明的模型驱动飞轮转得更快,而更快的飞轮又让模型变得更加聪明。如果仅仅将智能视为比赛的全部,行业便无异于抛弃了这一巨大复合效应。
我们之所以确信这个飞轮真实有效,是因为我们已经在自身业务中将其付诸实践。Applied Intuition在物理智能的前沿探索了十年——涵盖汽车、卡车、采矿、农业和国防等领域的感知、仿真、验证及整车软件。在过去一年里,我们基于这一基础设施构建了一个Agent平台,命名为Dana。我们的工程师已在其上构建了上千个内部应用与Agent。借助Dana,开发周期缩短了约20倍,同时交付质量显著提升。部署频率从过去每几周一次提高到每天多次。曾经需要数月才能构建的应用,如今只需数天乃至数小时。更具启发性的是,那些过去因投入成本过高而无法立项的应用,现在也成为了常态化的研发项目。当构建成本降低一个数量级时,值得去构建的事物边界将扩大不止一个数量级。
智能让强大的工程系统成为可能,而工程系统则让智能真正发挥价值。两者缺一不可。
如果整个行业继续仅仅押注于智能本身,那么物理AI的下一个十年将会进展缓慢:充满令人眼花缭乱的Demo、历时数年的研发项目,以及机器在实验室里的能力与真实世界实际运行能力之间日益扩大的鸿沟。届时模型将极其出色,但部署曲线却将顽固地保持平缓,因为每一次技术突破,都不得不排队等待那些仍以旧有速度吸收变革的工程组织去消化。
将前沿智能与Agent工程系统相结合,这条曲线就会迎来向上拐点。物理AI将开始释放其全部潜能:农场能够在劳动力短缺和气候冲击下稳定产能;矿山实现持续且更安全的开采;货运网络可在遭遇突发状况时自主调整路线;国防系统能够在受损或恶劣条件下保持作战韧性。数千亿美元规模的市场正在向同一个技术栈靠拢,而学习闭环正是所有这一切的核心所在。
软件之所以吞噬世界,是因为它大幅降低了为数字经济构建应用的成本。物理AI也将对物理世界重演这一过程,但前提是构建智能机器必须像构建软件一样快速且高效迭代,同时又不牺牲安全攸关系统所要求的严谨性。这不仅需要最顶尖的模型,更需要对我们的工程模式进行重构——而这后半部分,几乎还没有人在着手构建。
二十年后,人们不会记得哪家公司在2027年拥有最好的世界模型,但人们会铭记是哪家公司探索出了将智能持续转化为实际部署系统的方法。而这,正是我们一直致力于解决的问题。
译者:boxi。