视觉扩展对视觉-语言模型自然语言理解能力的影响
计算与语言
2021-09-24 v2 人工智能
摘要
构建视觉-语言(V&L)模型的一种方法是通过对语言模型进行结构修改和 V&L 预训练来扩展它。这种扩展旨在使 V&L 模型从原始语言模型继承自然语言理解(NLU)能力。为了考察这一目标实现的程度,我们提出使用 NLU 基准(GLUE)来评估 V&L 模型。我们比较了五个采用相同预训练训练的 V&L 模型,包括单流和双流模型。双流模型通过大约将参数数量翻倍来实现更高的模态独立性,因此预期能更好地保留 NLU 能力。我们的主要发现是,与预期相反,双流模型的得分与单流模型相差不大。进一步的分析表明,除少数例外,预训练导致了 NLU 任务中的性能下降。这些结果表明,采用单流结构并设计预训练方法,可能是提升 V&L 扩展中语言知识保持效果的有效途径。
引用
@article{arxiv.2104.08066,
title = {Effect of Visual Extensions on Natural Language Understanding in Vision-and-Language Models},
author = {Taichi Iki and Akiko Aizawa},
journal= {arXiv preprint arXiv:2104.08066},
year = {2021}
}
备注
to appear at EMNLP 2021. camera-ready version