中文

HOIDiNi:通过扩散噪声优化实现人-物交互

计算机视觉与模式识别 2025-10-22 v2

摘要

我们提出了HOIDiNi,一个文本驱动的扩散框架,用于合成真实且合理的人-物交互(HOI)。HOI生成极具挑战性,因为它需要严格的接触精度以及多样化的运动流形。虽然当前文献在真实感和物理正确性之间进行权衡,但HOIDiNi使用扩散噪声优化(DNO)直接在预训练扩散模型的噪声空间中进行优化,从而同时实现两者。这得益于我们的观察,即该问题可以分为两个阶段:一个以物体为中心的阶段,主要对手-物接触位置进行离散选择;以及一个以人为中心的阶段,细化全身运动以实现这一蓝图。这种结构化方法允许精确的手-物接触,同时不影响运动的自然性。仅在GRAB数据集上的定量、定性和主观评估清楚地表明,HOIDiNi在接触精度、物理有效性和整体质量方面优于先前的工作和基线。我们的结果展示了仅通过文本提示驱动,生成复杂、可控交互的能力,包括抓取、放置和全身协调。https://hoidini.github.io。

关键词

引用

@article{arxiv.2506.15625,
  title  = {HOIDiNi: Human-Object Interaction through Diffusion Noise Optimization},
  author = {Roey Ron and Guy Tevet and Haim Sawdayee and Amit H. Bermano},
  journal= {arXiv preprint arXiv:2506.15625},
  year   = {2025}
}

备注

Project page: https://hoidini.github.io