中文

视觉扩展对视觉-语言模型自然语言理解能力的影响

计算与语言 2021-09-24 v2 人工智能

摘要

构建视觉-语言(V&L)模型的一种方法是通过对语言模型进行结构修改和 V&L 预训练来扩展它。这种扩展旨在使 V&L 模型从原始语言模型继承自然语言理解(NLU)能力。为了考察这一目标实现的程度,我们提出使用 NLU 基准(GLUE)来评估 V&L 模型。我们比较了五个采用相同预训练训练的 V&L 模型,包括单流和双流模型。双流模型通过大约将参数数量翻倍来实现更高的模态独立性,因此预期能更好地保留 NLU 能力。我们的主要发现是,与预期相反,双流模型的得分与单流模型相差不大。进一步的分析表明,除少数例外,预训练导致了 NLU 任务中的性能下降。这些结果表明,采用单流结构并设计预训练方法,可能是提升 V&L 扩展中语言知识保持效果的有效途径。

关键词

引用

@article{arxiv.2104.08066,
  title  = {Effect of Visual Extensions on Natural Language Understanding in Vision-and-Language Models},
  author = {Taichi Iki and Akiko Aizawa},
  journal= {arXiv preprint arXiv:2104.08066},
  year   = {2021}
}

备注

to appear at EMNLP 2021. camera-ready version