多模态三维场景理解的最新进展:全面综述与评测
计算机视觉与模式识别
2023-10-25 v1 人工智能
摘要
多模态 3D 场景理解因其在自动驾驶和人机交互等诸多领域的广泛应用而受到相当关注。相比传统的单模态 3D 理解,引入额外模态不仅提升了场景解读的丰富性与精确性,也确保了更鲁棒、更具韧性的理解。这在仅依赖 3D 数据可能不足的多变且具挑战性的环境中尤为关键。尽管过去三年多模态 3D 方法的发展激增,尤其是那些融合多相机图像(3D+2D)与文本描述(3D+语言)的方法,但全面深入的综述明显缺失。本文中,我们呈现近期进展的系统性综述以弥合此缺口。我们首先简要介绍背景,正式定义各类 3D 多模态任务并总结其固有挑战。此后,我们提出一种新颖的分类法,依据模态与任务对现有方法彻底归类,探讨各自优势与局限。此外,给出了近期方法在若干基准数据集上的比较结果及富有洞见的分析。最后,我们讨论未解决的问题并提供若干未来研究的潜在方向。
引用
@article{arxiv.2310.15676,
title = {Recent Advances in Multi-modal 3D Scene Understanding: A Comprehensive Survey and Evaluation},
author = {Yinjie Lei and Zixuan Wang and Feng Chen and Guoqing Wang and Peng Wang and Yang Yang},
journal= {arXiv preprint arXiv:2310.15676},
year = {2023}
}