InterPose:从大规模网络视频中生成人物-物体交互
计算机视觉与模式识别
2025-12-23 v2
摘要
人类运动生成取得了显著进展,得益于基于大规模运动捕捉数据的扩散模型。然而,现有大多数工作针对的是空场景中孤立人物的动画,而在复杂 3D 场景中合成真实的人物-物体交互仍是计算机图形学和机器人技术中的关键挑战。一个向可生成多样化高保真人物-物体交互的障碍是缺乏包含丰富物体操作的大规模数据集。事实上,现有的运动捕捉数据通常局限于单人及有限物体集合的操作。为此,我们提出一种自动运动提取管道,并用于收集充满人物-物体交互的运动数据。我们的数据集 InterPose 包含 73.8K 序列的 3D 人体运动及其对应的文本标题,这些内容自动从 45.8K 部包含人物-物体交互的视频中获得。我们进行了广泛实验,证明 InterPose 为人类运动生成的最新方法带来了显著改进。此外,利用 InterPose,我们开发了一个基于 LLM 的智能体,实现对与多样化物体和场景相互作用的人的零样本动画。
关键词
引用
@article{arxiv.2509.00767,
title = {InterPose: Learning to Generate Human-Object Interactions from Large-Scale Web Videos},
author = {Yangsong Zhang and Abdul Ahad Butt and Gül Varol and Ivan Laptev},
journal= {arXiv preprint arXiv:2509.00767},
year = {2025}
}
备注
Accepted to 3DV 2026. Project page: https://mael-zys.github.io/InterPose/