全球首个多维度物理世界模拟模型 CurrentWorld-0 诞生

Current Robotics 最近发布了全新的模拟系统 CurrentWorld-0,这一系统开创了跨越实体、视角及多模态的物理世界模型。视频中,机器人成功打开了一个啤酒瓶,啤酒泡沫迅速上涌,液体从画面右下角流入杯中。看似简单的实拍视频,其实每一个细节均由模型根据机器人动作生成。这是这支团队在推出全身操作的机器人 Curr-0 后的又一力作,称其为交互式世界仿真器,与传统物理引擎截然不同。它并不依赖于人工设定公式,而是通过现实世界数据发现规律,实现了一种数据驱动的模拟方法。

当前市场上已有类似的方向,诸如1X的1X World Model、Physical Intelligence的Ctrl-World和SC3-Eval、DeepMind的WorldGym,还有英伟达的Cosmos Predict。然而,CurrentWorld-0 是首次将跨实体、多视角和力触觉预测整合在一个仿真器中,并用于模拟、学习以及与人类和机器人模型的交互。在这个仿真环境下,用户不仅能看到普通的双臂机械手,还能模拟和控制移动机器人及配备灵巧手的双足人形机器人。它们能处理的不再局限于刚体物体,诸如叠袜子、整理枕头、涂抹食物以及削黄瓜等任务,均可在该环境下得以实现。而且,无论是柔性物体还是流体,都能在适当条件下保持状态。

值得注意的并非只是画面如何仿真真实,而是当机器人动作发生变化时,模型需要确保不同视角、物体及接触过程能沿同一物理事件自然延续。CurrentWorld-0 还具备一个重要应用:评估机器人性能。如今训练一个大型模型,可以在短时间内同时运行数千个基准案例,从而迅速了解模型的优缺点。但在机器人评测中,受限于数量、空间、人工监控和任务复位等因素,测试规模难以扩展。虽然真实世界无法替代,但也难以成为一个可以无限复制的考场。

传统的物理仿真已部分解决了这类问题。以Isaac Sim为代表的仿真器可以并行进行大量实验,但前提是必须知道该如何构建该物理世界。刚体的摩擦、关节的运动等可以被人适当地定义,但如折叠衣物、涂抹面包、倒啤酒之类涉及柔性物体、流体和复杂接触的过程,往往无法逐一编码到物理引擎中。那么,是否能够让真实世界本身被“学习”并应用于一个可无限运行的环境呢?这正是 CurrentWorld-0 努力实现的目标:通过真实交互学习机器人动作后的环境变化。

如果预测能够足够准确,众多策略可以先在模型生成的环境中进行试验、错误和比较,之后将发现带回真实机器人。然而,用于评测机器人的世界模型绝不仅仅是生成可信的视频。更换机器人后,世界的规律应保持不变;当视角变化,仅观察结果应有所不同;而在发生接触时,视觉、力觉与触觉必须描述同一物理过程。因此,CurrentWorld 主要聚焦于三个方面:跨实体(Cross-Embodiment)、多视角(Multi-View)和力度触觉(Force-Tactile),最终目标是无论观察者和行为者是谁,世界都应保持一致。

CurrentWorld-0 的设计考虑了如何真正验证机器人的行为。首先,机器人执行的动作必须确实有效。虽然视频模型具备强大的视觉和运动先验,但这未必总是适用于评测机器人。例如,机械臂可能出现偏差,但模型可能依旧沿着预设轨迹生成,让物体“自然而然”随之移动,这可能掩盖实际的失败情形。一旦模型开始为机器人纠正错误,则评测将失去意义。Current Robotics 在此方面进行了深入研究,探讨动作可控性:机器人做出什么动作,环境就应该给出相应的结果。若动作失败,世界也必须允许失败的发生。

在此基础上,CurrentWorld 进一步解决了三大问题。首先,让不同机器人共享空间。由于固定臂和移动臂等不同结构的机器人在自由度、运动学及控制方法上各有不同,CurrentWorld 允许不同机器人保留各自的动作子空间。尽管身体不同,它们在施加作用时遵循的物理规律应是一致的。跨实体(Cross-Embodiment)的目标,就是为不同机器人提供独特的行动方式,但共享同一个物理世界的理解。其次,让不同视角的观察者看到相同的世界。头部、手腕与第三视角相机均能捕捉同一交互的多样切面;当一个视角中的物体发生移动,其他视角下的物体变动也需要保持一致。

让我们陪伴您,一起创造属于您的运动传奇。...

让我们陪伴您,一起创造属于您的运动传奇。...