语言特征至关重要:面向视觉-语言任务的有效语言表示
计算机视觉与模式识别
2019-08-20 v1 计算与语言
摘要
在视觉-语言(VL)任务中,语言和视觉特征难道不应被平等对待吗?许多VL方法将语言组件视为事后考虑,使用简单的语言模型,这些模型要么建立在仅用文本数据训练的固定词嵌入之上,要么从零开始学习。我们认为语言特征值得更多关注,并开展了比较不同词嵌入、语言模型和嵌入增强步骤在五个常见VL任务上的实验:图像-句子检索、图像描述生成、视觉问答、短语定位以及文本到片段检索。我们的实验提供了一些惊人结果:平均嵌入语言模型在检索式任务上优于LSTM;BERT等最先进表示在视觉-语言任务上表现相对较差。从这套全面实验中,我们提出了融入VL任务语言组件的一组最佳实践。为进一步提升语言特征,我们还展示了视觉-语言问题中的知识可跨任务迁移,通过多任务训练获得性能提升。该多任务训练应用于一种新颖的图导向视觉-语言嵌入(GrOVLE),我们从Word2Vec使用WordNet和基于Visual Genome构建的原创视觉-语言图改编得到它,提供即用型视觉-语言嵌入:http://ai.bu.edu/grovle。
引用
@article{arxiv.1908.06327,
title = {Language Features Matter: Effective Language Representations for Vision-Language Tasks},
author = {Andrea Burns and Reuben Tan and Kate Saenko and Stan Sclaroff and Bryan A. Plummer},
journal= {arXiv preprint arXiv:1908.06327},
year = {2019}
}
备注
ICCV 2019 accepted paper