GenHOI:面向未见物体的文本驱动 4D 人体-物体交互合成
计算机视觉与模式识别
2025-06-19 v1 人工智能
摘要
虽然扩散模型和大规模运动数据集已推动文本驱动的人体动作合成,但将这些进展扩展到 4D 人体-物体交互(HOI)仍具有挑战性,主要由于大规模 4D HOI 数据集的可得性有限。本研究中,我们引入 GenHOI,一个新型两阶段框架,旨在实现两个关键目标:1)对未见物体的泛化,2)高保真度 4D HOI 序列的合成。在 GenHOI 框架的初始阶段,我们采用 Object-AnchorNet 来重建未见物体的稀疏 3D HOI 关键帧,仅从 3D HOI 数据集中进行学习,从而减轻对大规模 4D HOI 数据集的依赖。随后,在第二阶段,我们引入一种接触感知扩散模型(ContactDM),用于将稀疏 3D HOI 关键帧平滑插值到密集且在时间上连贯的 4D HOI 序列。为提高生成 4D HOI 序列的质量,我们提出了一种新的接触感知编码器嵌入 ContactDM 中,以提取人体-物体接触模式,并提出了新的接触感知 HOI 注意力机制,以有效地将接触信号整合到扩散模型中。实验结果表明,我们在公开的 OMOMO 和 3D-FUTURE 数据集上实现了最前沿的成果,显示出对未见物体的强大泛化能力,同时实现了高保真度的 4D HOI 生成。
引用
@article{arxiv.2506.15483,
title = {GenHOI: Generalizing Text-driven 4D Human-Object Interaction Synthesis for Unseen Objects},
author = {Shujia Li and Haiyu Zhang and Xinyuan Chen and Yaohui Wang and Yutong Ban},
journal= {arXiv preprint arXiv:2506.15483},
year = {2025}
}