3D 密集描述综合综述:3D 场景中的物体定位与描述
计算机视觉与模式识别
2024-03-13 v1
摘要
三维 (3D) 密集描述是一项新兴的视觉 - 语言桥接任务,旨在为 3D 场景生成多个详细且准确的描述。由于与 2D 视觉描述相比,它更接近真实世界的表示,且 3D 点云源的数据收集和处理具有复杂性,因此该任务呈现出巨大的潜力和挑战。尽管现有方法广受欢迎且取得成功,但缺乏总结该领域进展的综合综述,这阻碍了其发展。在本文中,我们对 3D 密集描述进行了全面回顾,涵盖任务定义、架构分类、数据集分析、评估指标以及深入的繁荣讨论。基于对先前文献的综合,我们提炼出一个标准流程,作为现有方法的通用范式。我们还引入了现有模型的清晰分类法,总结了不同模块中涉及的技术,并进行了详细的实验分析。我们没有按时间顺序介绍,而是将方法分类为不同的类别,以便于探索和分析现有技术之间的差异和联系。我们还提供了阅读指南,以帮助具有不同背景和目的的读者高效阅读。此外,我们通过识别挑战并将其与相关任务的发展相对齐,提出了一系列 3D 密集描述的未来发展方向,为该领域的未来研究提供有价值的见解和启发。我们的目标是提供对 3D 密集描述的全面理解,促进进一步调查,并推动多媒体及相关领域中新应用的开发。
引用
@article{arxiv.2403.07469,
title = {A Comprehensive Survey of 3D Dense Captioning: Localizing and Describing Objects in 3D Scenes},
author = {Ting Yu and Xiaojun Lin and Shuhui Wang and Weiguo Sheng and Qingming Huang and Jun Yu},
journal= {arXiv preprint arXiv:2403.07469},
year = {2024}
}