中文

HOComp:交互感知的人-物合成

计算机视觉与模式识别 2025-07-23 v1

摘要

虽然现有的图像引导合成方法可能有助于将前景对象插入到背景图像的用户指定区域,实现区域内与图像其余部分不变的自然融合,但我们观察到,当任务涉及人-物交互时,这些现有方法通常难以合成无缝的交互感知合成。在本文中,我们首先提出了HOComp,一种新颖的方法,用于将前景对象合成到以人为中心的背景图像上,同时确保前景对象与背景人物之间的和谐交互及其外观一致性。我们的方法包括两个关键设计:(1) MLLM驱动的基于区域的姿态引导(MRPG),它利用MLLM识别交互区域以及交互类型(例如,持握和举起),为生成的交互姿态提供从粗到细的约束,同时结合人体姿态地标来跟踪动作变化并强制执行细粒度姿态约束;(2) 细节一致的外观保持(DCAP),它统一了形状感知注意力调制机制、多视角外观损失和背景一致性损失,以确保前景的形状/纹理一致以及背景人物的忠实再现。然后,我们提出了第一个用于该任务的数据集,名为交互感知人-物合成(IHOC)。在我们数据集上的实验结果表明,HOComp有效地生成了具有一致外观的和谐人-物交互,并在定性和定量上优于相关方法。

关键词

引用

@article{arxiv.2507.16813,
  title  = {HOComp: Interaction-Aware Human-Object Composition},
  author = {Dong Liang and Jinyuan Jia and Yuhao Liu and Rynson W. H. Lau},
  journal= {arXiv preprint arXiv:2507.16813},
  year   = {2025}
}