LOME:基于动作条件的自我中心世界模型学习人-物操控
计算机视觉与模式识别
2026-03-31 v1
摘要
学习人-物操控因其涉及细粒度且富含接触的运动而面临重大挑战。传统的基于物理的动画需要大量的建模和手动设置,更重要的是,它既不能很好地泛化到不同的物体形态,也无法有效地扩展到现实世界环境。为了解决这些局限性,我们引入了LOME,这是一种自我中心世界模型,能够根据输入图像、文本提示和每帧人体动作(包括身体姿态和手势)生成逼真的人-物交互视频。LOME通过在训练过程中联合估计空间人体动作和环境上下文,将强大而精确的动作引导注入到物体操控中。在对多样化的自我中心人-物交互视频进行微调后,LOME不仅展现出高动作跟随准确性和对未见场景的强大泛化能力,还展示了手-物交互的真实物理后果,例如在执行“倒”动作后,液体从瓶子流入杯子。大量实验表明,我们的基于视频的框架在时间一致性和运动控制方面显著优于最先进的基于图像和基于视频的动作条件方法以及图像/文本到视频生成模型。LOME为逼真的增强现实/虚拟现实体验和可扩展的机器人训练铺平了道路,而不受限于模拟环境或依赖显式的3D/4D建模。
引用
@article{arxiv.2603.27449,
title = {LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model},
author = {Quankai Gao and Jiawei Yang and Qiangeng Xu and Le Chen and Yue Wang},
journal= {arXiv preprint arXiv:2603.27449},
year = {2026}
}