优化驾驶场景的视觉问答模型:弥合人类与机器注意力模式之间的差距
计算机视觉与模式识别
2024-06-14 v1
摘要
视觉问答(VQA)模型通过允许车辆分析视觉输入和文本查询,促进车辆与其乘员或其他道路使用者之间的自然交互和信任,在增强自动驾驶系统的感知能力方面发挥着关键作用。本研究调查了人类与VQA模型在回答驾驶相关问题时的注意力模式差异,揭示了所观察对象的差异。我们提出了一种集成滤波器的方法来优化模型的注意力机制,优先处理相关对象并提高准确性。利用LXMERT模型进行案例研究,我们比较了预训练模型和集成滤波器模型的注意力模式,以及使用NuImages数据集的人类答案,从而深入了解特征优先级。我们使用主观评分框架评估了模型,结果表明,特征编码器滤波器的集成通过优化注意力机制提升了VQA模型的性能。
引用
@article{arxiv.2406.09203,
title = {Optimizing Visual Question Answering Models for Driving: Bridging the Gap Between Human and Machine Attention Patterns},
author = {Kaavya Rekanar and Martin Hayes and Ganesh Sistu and Ciaran Eising},
journal= {arXiv preprint arXiv:2406.09203},
year = {2024}
}