世界模型听起来很大,但核心还是做提前预演。在我看来,还不如 VLA 模型来的更加的扎实。当然,实际的运行轨迹应该是这两者的互相融合。第一,我们需要 VLA 做一些比较可靠的事情,同时也需要世界模型做更好的预演以节省成本。但真正的难度是在对于真实世界的理解,也就是文中所说的不在于你看到水杯或者去对于水杯 拿到水杯以后动作的预演,而在于真正拿到水杯的那一瞬间对于水杯的重量、摩擦力等等的实际的探测。这个需要更多的 传感器,也就是智能硬件来实现。
评论