理解视觉-语言任务中的注意力机制
计算机视觉与模式识别
2022-09-23 v2 计算与语言
摘要
注意力机制已作为重要组件被应用于各类视觉-语言(VL)任务中,以弥合视觉与文本特征之间的语义鸿沟。尽管注意力已在 VL 任务中被广泛使用,但不同注意力对齐计算在桥接视觉与文本线索语义鸿沟方面的能力尚未得到审视。在本研究中,我们通过考察注意力分数计算方法并检验其如何表征视觉区域与文本词元对于全局评估的重要性,对理解注意力对齐的作用进行了全面分析。我们还分析了注意力分数计算机制在何种条件下更具(或更不具)可解释性,以及其可能如何影响模型在三项不同 VL 任务上的性能,包括视觉问答、文本到图像生成、文本与图像匹配(句子与图像检索)。我们的分析属首创,并提供了关于在 VL 任务训练阶段(基于注意力的跨模态模型和/或预训练模型中常被忽略)每种注意力对齐分数计算重要性的有益见解。我们的代码见:https://github.com/adlnlp/Attention_VL
引用
@article{arxiv.2208.08104,
title = {Understanding Attention for Vision-and-Language Tasks},
author = {Feiqi Cao and Soyeon Caren Han and Siqu Long and Changwei Xu and Josiah Poon},
journal= {arXiv preprint arXiv:2208.08104},
year = {2022}
}
备注
Accepted in COLING 2022