面向自动驾驶的预训练视觉问答模型性能分析
计算机视觉与模式识别
2023-07-31 v2
摘要
这篇短文对三种流行的视觉问答(VQA)模型(即 ViLBERT、ViLT 与 LXMERT)在回答驾驶场景相关问题方面的表现进行了初步分析。这些模型的性能通过将其回复与计算机视觉专家提供的参考答案的相似度进行比较来评估。模型的选择基于对多模态架构中 transformer 利用情况的分析。结果表明,采用跨模态注意力与后期融合技术的模型在驾驶视角下生成更优答案方面展现出良好潜力。该初步分析为后续涉及九个 VQA 模型的全面比较研究提供了起点,并为进一步探究 VQA 模型查询在自动驾驶场景中的有效性奠定了基础。补充材料见 https://github.com/KaavyaRekanar/Towards-a-performance-analysis-on-pre-trained-VQA-models-for-autonomous-driving。
引用
@article{arxiv.2307.09329,
title = {Towards a performance analysis on pre-trained Visual Question Answering models for autonomous driving},
author = {Kaavya Rekanar and Ciarán Eising and Ganesh Sistu and Martin Hayes},
journal= {arXiv preprint arXiv:2307.09329},
year = {2023}
}