HOI-PAGE:基于部件感知引导的零样文本生成人物-物体交互
图形学
2026-05-20 v2 计算机视觉与模式识别
摘要
我们提出HOI-PAGE,一种优先考虑部件级感知推理,以零样方式从文本提示生成高保真4维人物-物体交互(HOI)的新方法。与先前关注全局、整体人体-物体运动合成的工作不同,我们的方法显式地推理利用大型语言模型(LLM)所捕获的交互部件机制。我们将这种推理表示为结构化的部件感知图(PAG),作为高层次交互框架,用于指导三个阶段的合成:首先,将输入3D物体分解为语义部件;其次,从文本提示生成参考HOI视频,以提取基于部件的运动约束;最后,优化4维HOI运动序列,使其模仿参考动力学,同时满足部件级接触约束。大量实验表明,我们的方法灵活且能够生成复杂的多物体或多人物交互序列,在零样4维HOI生成方面显著提升了现实感与文本对齐度。
引用
@article{arxiv.2506.07209,
title = {HOI-PAGE: Zero-Shot Human-Object Interaction Generation with Part Affordance Guidance},
author = {Lei Li and Angela Dai},
journal= {arXiv preprint arXiv:2506.07209},
year = {2026}
}
备注
ICML 2026. Project page: https://craigleili.github.io/projects/hoipage/ Video: https://www.youtube.com/watch?v=gwXjOffCFyk