中文

TOUCH:基于文本引导的自由形式手-物体交互可控生成

计算机视觉与模式识别 2025-10-17 v1

摘要

手-物体交互(HOI)是人们表达意图的基础。现有 HOI 生成研究主要局限于固定的抓取模式,通过力闭合或通用意图指令等物理先验进行控制,即使通过精心设计的语言表达也是如此。这种过于宽泛的条件引入了强烈的归纳偏置,以稳定抓取为导向,因而无法捕捉日常 HOI 的多样性。为克服这些限制,我们提出了自由形式 HOI 生成,该任务旨在以细粒度意图为条件生成可控、多样且物理上合理的 HOI,将 HOI 从抓取扩展到推动、戳打、旋转等自由形式交互。为支持该任务,我们构建了 WildO2 数据集,包含来自网络视频的多样化 3D HOI 数据集。具体而言,它包含 4400 多个独特交互,覆盖 92 种意图和 610 种物体类别,每个交互都包含详细的语义注释。基于该数据集,我们提出了 TOUCH,一个以多级扩散模型为中心的三阶段框架,支持细粒度语义控制以生成超越抓取先验的多样化手部姿态。该过程利用显式接触建模进行条件控制,并通过接触一致性和物理约束进行后期优化,以确保真实性。全面实验表明,我们的方法能够生成可控、多样且符合物理法则的手部交互,代表日常活动。项目页面为 \href\href{https://guangyid.github.io/hoi123touch}{here}

关键词

引用

@article{arxiv.2510.14874,
  title  = {TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions},
  author = {Guangyi Han and Wei Zhai and Yuhang Yang and Yang Cao and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2510.14874},
  year   = {2025}
}