从图像到语言:视觉问答(VQA)方法、挑战与机遇的批判性分析
计算机视觉与模式识别
2024-11-05 v2 人工智能
摘要
视觉问答(VQA)这一多模态任务涵盖计算机视觉(CV)与自然语言处理(NLP)要素,旨在针对任意视觉输入生成问题答案。随着时间推移,VQA的范围已从聚焦大量自然图像的数据集,扩展到包含合成图像、视频、3D环境及多种其他视觉输入的数据集。大预训练网络的出现将早期依赖特征提取与融合方案的VQA方法转向视觉语言预训练(VLP)技术。然而,缺乏涵盖传统VQA架构与当代基于VLP方法的综合性综述。此外,从VQA视角审视的VLP挑战尚未被深入探索,留下了潜在开放问题浮现的空间。我们的工作呈现了一份VQA领域综述,剖析该领域历史中VQA数据集与方法的复杂性,引入细致分类法对VQA各个层面归类,并强调近期趋势、挑战与改进空间。我们进一步将VQA推广至多模态问答,探索与VQA相关的任务,并提出一组供未来研究的开放问题。本工作旨在通过阐明潜在研究途径并拓展领域边界,为初学者与专家提供指引。
引用
@article{arxiv.2311.00308,
title = {From Image to Language: A Critical Analysis of Visual Question Answering (VQA) Approaches, Challenges, and Opportunities},
author = {Md Farhan Ishmam and Md Sakib Hossain Shovon and M. F. Mridha and Nilanjan Dey},
journal= {arXiv preprint arXiv:2311.00308},
year = {2024}
}