DAG:释放扩散模型在开放词汇3D动作 grounding 潜力
计算机视觉与模式识别
2025-08-05 v1
摘要
3D 物体动作 grounding 指的是预测3D物体上可触摸的区域,这对于人类-物体交互、人类-机器人交互、具身感知和机器人学习至关重要。最近的研究通过从演示图像中学习来解决这一问题,但这些方法无法捕捉图像中通用的动作知识,导致泛化能力差。为此,我们提出使用文本到图像扩散模型来提取通用的动作知识,因为我们发现此类模型能够生成在语义上有效的HOI图像,这表明其内部表示空间与真实世界的动作概念高度相关。具体而言,我们引入了DAG——一个基于扩散模型的3D动作 grounding 框架,它利用冻结的扩散模型内部表示, unlocks 动作知识以完成3D动作 grounding。我们进一步引入了动作模块和多来源动作解码器,以实现3D稠密动作预测。大量实验评估表明,我们的模型在众多成熟方法之上表现卓越,并展现出开放世界的泛化能力。
关键词
引用
@article{arxiv.2508.01651,
title = {DAG: Unleash the Potential of Diffusion Model for Open-Vocabulary 3D Affordance Grounding},
author = {Hanqing Wang and Zhenhao Zhang and Kaiyang Ji and Mingyu Liu and Wenti Yin and Yuchao Chen and Zhirui Liu and Xiangyu Zeng and Tianxiang Gui and Hangxing Zhang},
journal= {arXiv preprint arXiv:2508.01651},
year = {2025}
}