黑色幽默
《It Ends》评测_我的网站

一 | 《科创板日报》7月20日讯(记者 杨小小)人形机器人要加快实现应用落地,无疑已成为行业内外的普遍共识。
《It Ends》将于 8 月 21 日星期五在部分影院上映,并于 8 月 28 日开启大规模公映。还记得传声头像(Talking Heads)的那首《Road to Nowhere》吗?歌词是这样开始的:“好吧,我们知道我们要去哪里 / 但我们不知道我们曾身处何方”以及“我们不是小孩子了 / 我们知道自己想要什么 / 未来是确定的 / 给我们时间去解决它”……大卫·拜恩(David Byrne)的这些词句似乎深深植根于《It Ends》制作团队的脑海中。
围绕这一目标展开的人形机器人“大脑”能力补强,也已经持续了一段时间。

二 | 但在这个过程中,行业逐渐发现,机器人拥有理解和决策能力,并不等于已经掌握了可执行的技能,从认知到动作之间,还需要完成动作策略生成、本体适配和反馈修正等重要环节。这部潜力十足的独立恐怖惊悚片讲述了四个朋友的汽车旅行演变成了一场在永无止境的道路上的存在主义狂欢……你可以说,这是一条通往虚无之路。由新人 Alexander Ullom 编剧、执导(并剪辑)的《It Ends》,虽然不像传声头像的歌曲听起来那样欢快——毕竟它是一部恐怖片——但同样充满乐趣。四位主演(Phinehas Yoon 饰演 James,Akira Jackson 饰演 Day,Noah Toth 饰演 Fisher,以及 Mitchell Cole 饰演 Tyler)之间俏皮的插科打诨撑起了电影的大部分篇幅,尤其是在开篇阶段。

三 | 他们无意中闯入了一个场景,放在几十年前,这可能就是罗德·塞林(Rod Serling)的《迷离时空》(The Twilight Zone)中的一集(或者是萨特的一出戏剧):他们所行驶的道路永远没有转弯,这群人慢慢意识到自己被困在了一场铺就的噩梦中。 在今年的世界人工智能大会上,具身智能“深圳军团”不约而同地都在朝这个方向进行能力展出,试图缩短模型能力到真机执行的链路。如果他们敢停车太久,疯狂的疯子就会从周围的森林中冲出来吞噬他们。他们唯一的选择?开车,宝贝,继续开。借用歌曲的比喻,这些人可能正走在通往炼狱的路上,而他们肯定不喜欢那种结局……对于这类密闭空间电影,一个绕不开的问题是:既然电影场景固定,内容是否还能保持趣味性?《It Ends》并没有被局限性所束缚,反而从这种受限的设定中获益。

四 | 影片的前 15 分钟左右几乎完全是在车内拍摄的,通过特写和双人镜头展现角色们聚在一起闲聊,为重逢感到高兴(Tyler 最近不在圈子里,但现在另外三人大学毕业了,他又回来了)。即使在开场时情况变得越来越令人担忧——这条路的出口到底在哪儿!?——Ullom 的镜头依然保持克制。 从数据到动作策略 跨维智能将这段距离进一步前移到了模型训练的数据端。

五 | 这位导演知道他有 90 分钟的戏份要在这辆车内和车外的道路上展开,别无他处,他榨干了这些场景的每一分价值。当 Tyler 和 James 下车去森林探查时,汽车闪烁的危险报警灯投射出断断续续的红光,就在那时……等等……外面是不是有一张脸……?刚才树后是不是有什么东西动了?然后,“砰”的一声:成群的迷失灵魂或食尸鬼(不管他们是什么)向我们的角色袭来。 此次WAIC,跨维智能发布并开源Aligned DexWorld。

六 | 据公司介绍,该数据集试图将真人示教、真机遥操和仿真合成等不同来源的数据,在统一的三维物理空间和时间序列中完成对齐。 它所针对的是具身智能训练数据的异构问题:不同来源的数据在视角、本体构型和动作空间上存在差异,单纯“堆数据”并不必然提升模型效果,未经对齐的混合训练甚至可能产生负迁移。是的,这是一部“闲逛式”电影——这也是角色本身以及电影吸引力的重要组成部分。 在数据对齐之外,跨维智能还首次展示了仿真引擎DexVerse的生成式仿真能力,通过持续生成不同的物体姿态、场景布局和交互任务,为世界模型提供更多样化的训练数据。按照公司的技术路径,Aligned DexWorld解决的是不同数据能否被模型共同学习,DexVerse则负责扩展模型可以学习的物理场景。这就是《It Ends》的精妙之处:剧本允许角色在观看时提出与观众相同的疑问。 现场展出的手机装盒和商超扫码Demo,进一步呈现了上述技术链路在真机执行端的效果。这些从森林中疯狂冲出来试图超车、哀求着要进车的人,他们一定是死了,对吧?是活人的鬼魂还是阴影?这意味着 James、Tyler、Day 和 Fisher……好吧,也许他们也死了?他们是因为在“现实”生活中做的某些事而受到惩罚吗?问题被抛了出来:这辆车里谁最近做了一些非常、非常坏的事,需要因果报应!?现在就说出来!关于这里发生了什么的疑问和理论不断浮现,尤其是由这群人中最具行动力和分析能力的 James 提出的。但答案又是另一回事。手机装盒机器人需要连续完成取盒、放机、对位和合盖,并在物料偏移、漏抓等情况下重新规划动作;商超扫码机器人则要适应不同瓶型和随机摆放姿态,完成抓取、扶正、扫码及放置,并通过视觉信号判断扫码是否成功。最终,这群人对他们的处境产生了一种病态的适应,只是不停地开车、开车、开车。至少在一段时间内是这样。这部电影是关于每个人进入成年期后所面临的道路吗?《It Ends》开始于四个人谈论在校园生活结束后的未来(如果你愿意这么理解的话)。Tyler 已经作为社会人在现实世界打拼,但他似乎对自己目前的生活轨迹并不感到快乐或满足。 也就是说,跨维智能试图补上的,是从模型能力到真机执行的上游基础:先让不同来源的数据说同一种物理语言,再让模型学到的能力更顺畅地迁移至真机。 如果说跨维智能试图让模型从训练阶段开始,更准确地理解物理世界中的动作,智平方进一步关注的,则是模型理解任务后,如何将认知、协调和执行串成闭环。 智平方这次WAIC带来了搭载NeuroVLA类脑大模型的AlphaBot 2。 按照公司的设计,NeuroVLA将机器人控制体系分为“皮层-小脑-脊髓”三个层次:皮层负责语义理解和任务规划,小脑负责高频运动协调与动态修正,脊髓则负责毫秒级运动执行和安全反射。

七 | James 对一切都做了深入思考,甚至找好了工作——还拍了一张穿着“第一次领圣体”般的正式工装的自拍来证明——但他看起来也并不开心。

八 | Day 住在家里,而 Fisher……他只是随波逐流吗?如果他真的有下一步计划,那我肯定是漏掉了。在这背景下,这些 Z 世代的年轻人只是在“闲逛”——是的,这是一部闲逛式电影——这正是角色和电影本身魅力的核心。

九 | 高层模型的任务规划无法直接转化为连续的关节动作。机器人还需在执行中持续感知环境和自身状态,在目标变化或动作失败时动态调整,并维持长流程任务的时序信息。Ullom 曾表示,他在创作《It Ends》时受到了理查德·林克莱特《懒虫》(Slacker)的部分启发,这一点显而易见,无论这群人是在争论“一个拿枪的人和一个人带着 50 只老鹰谁会赢”,还是在应对连续数周共同生活在车内的单调乏味。

十 | 智平方强调的主动感知、故障自恢复和时序记忆,就是为了打通这些环节。(还必须指出的是,Ullom 在他的母校佛罗里达州立大学的一个小型 Volume LED 虚拟摄影棚内完成了大部分拍摄,这简直令人印象深刻。)虽然影片的意图从未明确表达,但其传递的信息却令人难以释怀。

十一 | 在WAIC展示的PCB上下料任务中,AlphaBot 2需要面对不同型号、尺寸的PCB,以及透明、反光托盘,连续完成托盘取料、上下料、移动运输和双臂协同等动作。这四个人正试图在生活中寻找出路,随着每个人以不同的方式对处境做出反应,他们的命运似乎越来越被锁定。如果不是为了不断向前推进,现实世界的生活又是什么呢?做得更好、赚得更多、得到更多、到达“那里”。当你驾车离去时,那些抓挠你的人?无视他们,他们挡路了,他们是竞争对手。相比完成一次固定抓取,这类任务更考验感知、任务规划、动态修正以及运动执行之间能否形成闭环。

十二 | 从动作策略到真机执行 模型形成动作策略之后,还需要经过具体场景和机器人本体的适配。 乐聚机器人试图通过后训练,补上通用模型与具体岗位技能之间的距离。作为以本体和运动控制见长的人形机器人企业,在路径上,乐聚没有选择从头训练通用具身基模,而是由上游模型企业完成通用大脑的预训练,再结合自身机器人本体和工业场景开展垂域后训练、本体适配和真机评测。听着,现在的就业市场就是这么残酷,规矩不是我定的——我只是遵守而已。 乐聚机器人技术负责人王强对《科创板日报》记者表示,这一过程可以类比为是给机器人开设“技校”:基础模型解决认知广度,后训练则让机器人围绕具体岗位学习技能。这简直是一场恐怖秀。

十三 | 以快递分拣为例,蚂蚁灵波的LingBot-VLA 2.0已经通过预训练掌握识别物体、理解指令和基础抓放等能力;乐聚进一步采集300条任务数据进行后训练,让模型学习不同包裹在具体环境中的识别、抓取与分类方法,并将其部署至夸父机器人完成真机任务闭环。 据悉,乐聚目前已将数据处理、代码适配、模型后训练和真机部署测试等流程封装为后训练工具链。

十四 | 此次WAIC,乐聚展示的纸箱拆垛、塑料箱拆垛和小件上料,也对应了这套转化路径。乐聚方面人士对记者表示,在展会期间,夸父机器人连续三天每天接近10小时不间断完成了纸箱拆垛等任务,机器稳定性出现了初步的量变突破。 逐际动力则把认知到执行的链路进一步拆分为Sys2认知层、Sys1技能层和Sys0运控层。认知层负责理解任务和作出决策,技能层承接具体能力,运控层则负责将其落实为本体动作。

十五 | 逐际动力此次展示的Oli机器人搭载COSA人形大脑系统和WBT全身运动基础模型。其中,WBT能够实时追踪机器人全身关节,并在动作执行过程中维持平衡。

十六 | 现场动捕演员连续完成深蹲、太极和舞蹈等动作,Oli则进行实时复现。与单个预设动作相比,这一演示更侧重展示长程动作如何被映射至机器人本体并稳定执行。 在操作端,逐际动力还展示了搭载COSA系统的TRON2双臂机器人。现场,TRON2通过视觉感知和语音交互,自主抓取糖果并递送给用户,呈现出机器人从感知、技能生成到底层执行之间的衔接。 可以看到,随着人形机器人产业的可见度不断提升,行业内外的期待也在持续拉高。人形机器人企业的展示无疑都在试图回应同一个问题:如何在技术路径尚未完全收敛的情况下,跨过实用性的门槛。 但WAIC的演示仍不同于规模化应用。人形机器人面对新任务需要多少数据、训练和适配周期多长,技能能否跨本体、跨场景复用,以及在长期运行中能否保持稳定,仍需更多真实项目验证。 (科创板日报记者 杨小小)。

十七 |
Current article:http://6un.ganweilingmukuai.shop/news/20260826_4938.html
Published on:21:39:26
