多样化联合视觉-语言分词学习
计算机视觉与模式识别
2023-06-19 v2
摘要
构建图像与文本之间的联合表示是视觉问答和视频问答等任务的关键步骤。本工作中,我们发现这些表示不仅必须联合捕获来自两种模态的特征,还应当具有多样性以获得更好的泛化性能。为此,我们通过使分词学习过程多样化来提出联合视觉-语言表示学习,从而能够从两种模态中学习到彼此充分解耦的 token。我们观察到,我们的方法在大多数设定下优于基线模型,并与最先进的方法具有竞争力。
引用
@article{arxiv.2306.03421,
title = {Diversifying Joint Vision-Language Tokenization Learning},
author = {Vardaan Pahuja and AJ Piergiovanni and Anelia Angelova},
journal= {arXiv preprint arXiv:2306.03421},
year = {2023}
}
备注
Accepted to Transformers for Vision (T4V) workshop, CVPR 2023; 7 pages, 5 figures