R2G:在3D场景中的推理式 grounding 方法
计算机视觉与模式识别
2024-12-13 v2
摘要
我们提出了一种名为Reasoning to Ground(R2G)的神经符号模型,用于以推理方式将目标对象置于3D场景中。与先前工作不同,R2G显式地以基于语义概念的场景图建模3D场景;递归地模拟注意力在对象实体之间的转移;从而使以最高概率对目标对象进行 grounding 的过程具有可解释性。具体而言,R2G分别将多个对象属性嵌入图节点,将场景中实体之间的空间关系嵌入边缘,利用预定义的语义词汇表。为指导注意力转移,我们采用学习或提示基方法分析参考言语,并将其转换为同一语义空间内的推理指令。在每一轮推理中,R2G要么合并当前注意力分布与指令与嵌入实体属性之间的相似度,要么基于指令与嵌入空间关系之间的相似度在场景图上转移注意力。在Sr3D/Nr3D基准测试上的实验表明,R2G在保持 improved 可解释性的同时,以与先前工作相当的效果实现了3D语言 grounding,开辟了新的研究路径。
关键词
引用
@article{arxiv.2408.13499,
title = {R2G: Reasoning to Ground in 3D Scenes},
author = {Yixuan Li and Zan Wang and Wei Liang},
journal= {arXiv preprint arXiv:2408.13499},
year = {2024}
}