MiKASA:面向3D视觉基础的多键锚与场景感知Transformer
计算机视觉与模式识别
2024-12-03 v4
摘要
3D视觉基础涉及将自然语言描述与3D空间中对应的物体进行匹配。现有方法在物体识别精度方面常面临挑战,并在解释复杂语言查询时存在困难,特别是对于涉及多个锚点或依赖视角的描述。为此,我们提出了 MiKASA(Multi-Key-Anchor Scene-Aware)Transformer。我们新颖的端到端训练模型集成了基于自注意力的场景感知物体编码器和一种原创的多键锚技术,提高了物体识别精度和空间关系的理解。此外,MiKASA 提高了决策过程的可解释性,便于错误诊断。我们的模型在 Referit3D 挑战赛的 Sr3D 和 Nr3D 数据集上均取得了最高的总体准确率,特别是在需要依赖视角描述的类别中大幅领先。
引用
@article{arxiv.2403.03077,
title = {MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual Grounding},
author = {Chun-Peng Chang and Shaoxiang Wang and Alain Pagani and Didier Stricker},
journal= {arXiv preprint arXiv:2403.03077},
year = {2024}
}
备注
CVPR 2024