基于注意力机制的认知级场景理解
计算机视觉与模式识别
2025-03-10 v3 人工智能
摘要
给定问题-图像输入,视觉常识推理(VCR)模型可预测答案及相应理由,这需要来自真实世界的推理能力。VCR 任务要求利用多源信息、学习不同层次的理解与广泛的常识知识,是一项认知级场景理解任务。VCR 任务因其在视觉问答、自动驾驶系统和临床决策支持等方面的广泛应用而引起研究者兴趣。以往解决 VCR 任务的方法通常依赖预训练或利用具有长依赖关系编码模型的记忆。然而,这些方法缺乏泛化性且在长序列中丢失信息。本文中,我们提出一种并行的基于注意力的认知 VCR 网络 PAVCR,其高效融合视觉-文本信息并并行编码语义信息,使模型能捕获丰富信息用于认知级推理。大量实验表明,所提模型在基准 VCR 数据集上相较现有方法取得显著改进。此外,所提模型为视觉常识推理提供了直观解释。
引用
@article{arxiv.2204.08027,
title = {Attention Mechanism based Cognition-level Scene Understanding},
author = {Xuejiao Tang and Wenbin Zhang},
journal= {arXiv preprint arXiv:2204.08027},
year = {2025}
}
备注
Published in Information