一种结合视觉与语言的基于注意力的新型聚合函数
计算机视觉与模式识别
2020-07-14 v2 计算与语言
机器学习
摘要
视觉与语言的联合理解近期在计算机视觉与自然语言处理社区中备受关注,伴随图像描述、图文匹配和视觉问答等任务的出现。由于图像与文本均可编码为元素集合或序列——如区域与词——需要恰当的归约函数将编码元素集合转换为单一响应,如分类或相似度分数。本文提出一种用于视觉与语言的新型全注意力归约方法。具体而言,我们的方法采用一种新型交叉注意力变体为各模态每个元素计算一组分数,并执行可学习的跨模态归约,可用于分类与排序。我们在图文匹配与视觉问答上测试该方法,在 COCO 与 VQA 2.0 数据集上与其他归约选择进行公平比较。实验上,我们证明该方法在两项任务上均带来性能提升。此外,我们进行消融实验以验证方法各组件的作用。
引用
@article{arxiv.2004.13073,
title = {A Novel Attention-based Aggregation Function to Combine Vision and Language},
author = {Matteo Stefanini and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
journal= {arXiv preprint arXiv:2004.13073},
year = {2020}
}
备注
ICPR 2020