视觉理解之旅:视觉问答演进综述
计算机视觉与模式识别
2025-01-14 v1
摘要
视觉问答 (VQA) 是一个跨越计算机视觉 (CV) 和自然语言处理 (NLP) 的交叉学科,使人工智能系统能够回答关于图像的问题。自 2015 年问世以来,VQA 由于深度学习、注意力机制和基于 transformer 的模型等技术进步而迅速发展。本综述追溯了 VQA 从早期阶段的演进历程,以及注意力机制、组合推理和视觉语言预训练方法等重大突破。我们强调了塑造 VQA 系统发展的关键模型、数据集和技术,强调 transformer 架构和多模态预训练在推动近期进展中的核心作用。此外,我们探讨了 VQA 在诸如医疗保健等领域的专业应用,讨论了数据偏差、模型可解释性以及需要常识推理等持续挑战。最后,我们讨论了大型多模态语言模型的新兴趋势以及外部知识的集成,为 VQA 的未来方向提供了洞察。本文旨在为 VQA 的演进提供全面概述,突出其当前状态及潜在发展。
引用
@article{arxiv.2501.07109,
title = {The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering},
author = {Anupam Pandey and Deepjyoti Bodo and Arpan Phukan and Asif Ekbal},
journal= {arXiv preprint arXiv:2501.07109},
year = {2025}
}