如何完成该动作?面向日常交互的 3D 手部运动与接触合成
计算机视觉与模式识别
2025-04-17 v1 人工智能
机器学习
摘要
我们致力于解决一个新颖问题:以单张 RGB 视图、动作文本以及物体上的一个 3D 接触点作为输入,预测 3D 手部运动和接触图(或交互轨迹)。我们的方法包括:(1) 交互码本:一个 VQVAE 模型,用于学习手部姿态和接触点的潜在码本,从而有效地将交互轨迹标记化;(2) 交互预测器:一个 transformer-decoder 模块,通过使用索引器模块从学习到的码本中检索潜在可供性,根据测试时的输入预测交互轨迹。为了训练我们的模型,我们开发了一个数据引擎,从多样化的 HoloAssist 数据集中提取 3D 手部姿态和接触轨迹。我们在一个基准上评估了我们的模型,该基准在观察到的物体和交互多样性方面比现有工作大 2.5 到 10 倍,并测试了模型在物体类别、动作类别、任务和场景之间的泛化能力。实验结果表明,在所有设置下,我们的方法均优于 transformer 和 diffusion 基线。
引用
@article{arxiv.2504.12284,
title = {How Do I Do That? Synthesizing 3D Hand Motion and Contacts for Everyday Interactions},
author = {Aditya Prakash and Benjamin Lundell and Dmitry Andreychuk and David Forsyth and Saurabh Gupta and Harpreet Sawhney},
journal= {arXiv preprint arXiv:2504.12284},
year = {2025}
}
备注
CVPR 2025, Project page: https://ap229997.github.io/projects/latentact