基于动态卷积的语言引导视觉识别
计算机视觉与模式识别
2023-09-15 v2
摘要
在本文中,我们致力于通过探索语言引导的视觉识别来建立一个统一且端到端的多模态网络。为实现这一目标,我们首先提出一种称为语言相关卷积(LaConv)的新型多模态卷积模块。其卷积核基于自然语言信息动态生成,有助于为不同的多模态样本提取差异化的视觉特征。基于 LaConv 模块,我们进一步构建了首个完全由语言驱动的卷积网络,称为 LaConvNet,它可以在一个前向结构中统一视觉识别与多模态推理。为验证 LaConv 和 LaConvNet,我们在两个视觉与语言任务(即视觉问答(VQA)和指代表达理解(REC))的四个基准数据集上进行了大量实验。实验结果不仅显示了 LaConv 相较于现有多模态模块的性能提升,也印证了 LaConvNet 作为一个统一网络的优势,包括紧凑的网络结构、高泛化能力和优异的性能,例如在 RefCOCO+ 上提升 4.7%。
引用
@article{arxiv.2110.08797,
title = {Towards Language-guided Visual Recognition via Dynamic Convolutions},
author = {Gen Luo and Yiyi Zhou and Xiaoshuai Sun and Yongjian Wu and Yue Gao and Rongrong Ji},
journal= {arXiv preprint arXiv:2110.08797},
year = {2023}
}