中文

语言空间中的图像:探索大语言模型对视觉与语言任务的适用性

计算与语言 2023-05-24 v1

摘要

大语言模型已通过零样本或少样本学习范式在各种语言任务上展现出稳健性能。在多模态模型(可额外处理图像输入)正被积极研究的同时,其在规模与通用性上尚落后于纯语言模型。本工作中,我们探讨纯语言模型是否可用于需要视觉输入的任务——并且如我们所论证的,此类任务往往还需要强大的推理成分。与近期一些相关工作类似,我们利用独立的语言化模型使视觉信息对语言模型可用。具体而言,我们研究了在给定文本编码的视觉信息时,开源、开放访问的语言模型在五项视觉-语言任务上相对于 GPT-3 的性能。结果表明,即便样本有限,语言模型也能有效解决视觉-语言任务。该方法还通过提供将输出追溯至语言化图像内容的手段,增强了模型输出的可解释性。

关键词

引用

@article{arxiv.2305.13782,
  title  = {Images in Language Space: Exploring the Suitability of Large Language Models for Vision & Language Tasks},
  author = {Sherzod Hakimov and David Schlangen},
  journal= {arXiv preprint arXiv:2305.13782},
  year   = {2023}
}

备注

Accepted at ACL 2023 Findings