中文

通过自动设计的VLM引导的运动策略的人类-对象相互作用

计算机视觉与模式识别 2026-03-05 v3

摘要

人类-对象相互作用 (HOI) 合成对于动画、仿真和机器人等应用至关重要. 然而, 现有方法要么依赖昂贵的动作捕捉数据, 要么需要手动奖励工程, 限制了其可扩展性和通用性. 本 work 引入了首个统一的基于物理的HOI框架, 利用视觉语言模型 (VLM) 实现对多样化对象类型的长期相互作用, 包括静态、动态和关节对象. 我们引入VLM引导的相对运动动力学 (RMD), 一种细粒度时空二分表示, 自动构建目标状态和奖励函数用于强化学习. 通过对人类和对象部件之间的结构化关系进行编码, RMD使VLM能够在无需手动奖励调谐的情况下生成语义上有 grounding, 交互感知的运动指导. 为支持我们的方法, 我们提出了Interplay, 一个包含数千个长期静态和动态交互计划的新型数据集. 大量实验表明, 我们的框架在综合自然、类人运动方面优于现有方法, 适用于简单单任务和复杂多任务场景. 欲了解更多详情, 请访问我们的项目网页: https://vlm-rmd.github.io/.

关键词

引用

@article{arxiv.2503.18349,
  title  = {Human-Object Interaction via Automatically Designed VLM-Guided Motion Policy},
  author = {Zekai Deng and Ye Shi and Kaiyang Ji and Lan Xu and Shaoli Huang and Jingya Wang},
  journal= {arXiv preprint arXiv:2503.18349},
  year   = {2026}
}

备注

iclr camera ready