中文

BLA 基准:探究预训练多模态模型的基础语言能力

计算与语言 2024-01-22 v1 人工智能 计算机视觉与模式识别

摘要

尽管预训练的语言-视觉模型在下游任务中取得了令人印象深刻的性能,这是否反映了对图像-文本交互的恰当理解仍是一个开放问题。在这项工作中,我们探究它们在多大程度上处理基础语言结构——主动-被动语态、并列结构和关系从句——这些即便是学龄前儿童通常也能掌握。我们提出 BLA,一个新颖的、自动构建的基准,用于在这些基础语言能力上评估多模态模型。我们表明,不同类型的基于 Transformer 的系统,如 CLIP、ViLBERT 和 BLIP2,在零样本设置下普遍在 BLA 上表现不佳,与之前的发现一致。我们的实验特别表明,大多数被测模型在通过结构特定样本微调或提示时仅边际受益。然而,生成式的 BLIP2 展现出有希望的趋势,尤其是在上下文学习设置中。这为将 BLA 不仅用作评估基准,也用于改进模型的基础语言能力打开了大门。

关键词

引用

@article{arxiv.2310.15061,
  title  = {The BLA Benchmark: Investigating Basic Language Abilities of Pre-Trained Multimodal Models},
  author = {Xinyi Chen and Raquel Fernández and Sandro Pezzelle},
  journal= {arXiv preprint arXiv:2310.15061},
  year   = {2024}
}

备注

This is the camera-ready version of the paper that will be published in the Proceedings of EMNLP 2023 (Singapore, 6-10 December 2023)