一种通用且可微的物体与手交互表示
计算机视觉与模式识别
2024-12-02 v2
摘要
精确合成物体与手交互对于计算机视觉、增强现实 (AR) 和混合现实 (MR) 中的应用至关重要。尽管最近取得了进展,但重建或生成的 HOI 的准确性仍有待提高。一些技术通过将焦点从生成显式接触转移到使用丰富的 HOI 场,提高了稠密对应的准确性。然而,它们缺乏完全的可微性或连续性,并且是为特定任务量身定制的。相比之下,我们提出了一种粗略物体与手交互表示,这是一种用于 HOI 建模的新颖、通用且完全可微的场。CHOIR 利用离散无符号距离进行连续的形状和姿态编码,并利用多元高斯分布以少量参数表示稠密接触图。为了展示 CHOIR 的通用性,我们设计了 JointDiffusion,这是一种扩散模型,用于学习以含噪物体与手交互或仅以物体几何形状为条件的抓取分布,适用于细化和合成应用。我们证明了 JointDiffusion 在这两种应用中均优于 SOTA:在细化应用中将接触 F1 分数提高了 ,在合成应用中将仿真位移减少了 。我们的实验表明,与为特定任务设计的 SOTA 方法相比,带有 CHOIR 的 JointDiffusion 产生了更出色的接触精度和物理真实感。项目页面:https://theomorales.com/CHOIR
引用
@article{arxiv.2409.16855,
title = {A Versatile and Differentiable Hand-Object Interaction Representation},
author = {Théo Morales and Omid Taheri and Gerard Lacey},
journal= {arXiv preprint arXiv:2409.16855},
year = {2024}
}
备注
Accepted at the Winter Applications in Computer Vision 2025 conference. 9 pages, 6 figures. Project page: https://theomorales.com/CHOIR