中文

GenHOI:面向对象一致性的手部-物体交互,具有时序平衡和空间选择性的对象注入

计算机视觉与模式识别 2026-03-09 v1

摘要

手部-物体交互(HOI)是数字人类视频合成中的核心挑战,模型必须生成符合物理规律的接触并在帧之间保持物体身份一致。尽管最近的HOI再现方法取得了进展,但它们通常在域内训练和评估,难以在复杂的野外场景中泛化。相比之下,所有-in-one视频编辑模型表现更广泛,但仍在HOI特定问题上表现不佳,如物体外观不一致。本文提出GenHOI,一种针对预训练视频生成模型的轻量级增强方法,以时序平衡和空间选择性方式注入参考物体信息。对于时序平衡,我们提出Head-Sliding RoPE,为参考token分配特定的时序偏移量,将其影响在帧之间均匀分布,从而缓解3D RoPE的时间衰减,提高长程物体一致性。对于空间选择性,我们设计了两级空间注意力门,集中注意力于HOI区域并自适应调整其强度,在保持背景真实性的同时增强交互保真度。针对未见的野外场景进行大量定性和定量评估表明,GenHOI显著优于最先进的HOI再现和所有-in-one视频编辑方法。项目页面:https://xuanhuang0.github.io/GenHOI/

关键词

引用

@article{arxiv.2603.06048,
  title  = {GenHOI: Towards Object-Consistent Hand-Object Interaction with Temporally Balanced and Spatially Selective Object Injection},
  author = {Xuan Huang and Mochu Xiang and Zhelun Shen and Jinbo Wu and Chenming Wu and Chen Zhao and Kaisiyuan Wang and Hang Zhou and Shanshan Liu and Haocheng Feng and Wei He and Jingdong Wang},
  journal= {arXiv preprint arXiv:2603.06048},
  year   = {2026}
}