从视觉到语言的知识迁移:如何实现与如何度量?
计算与语言
2021-10-01 v2
摘要
大型语言模型已知存在幻觉问题,即易于输出错误或自相矛盾的陈述,表明其知识匮乏。对此提出的一种解决方案是为模型提供补充通过文本所获得知识的额外数据模态。我们研究利用视觉数据补充大型语言模型知识的方法,提出一种用于评估视觉知识向文本迁移(针对单模态或多模态语言模型)的方法。该方法基于两步:1) 一项查询记忆色(即知名物体的典型颜色)知识的全新任务,以及 2) 对模型训练数据进行过滤以清晰分离知识贡献。此外,我们引入了一种包含视觉想象步骤的模型架构,并用我们提出的方法对其进行评估。我们发现,我们的方法可成功用于度量模型中的视觉知识迁移能力,且我们的新颖模型架构在单模态设定下利用多模态知识方面展现出有前景的结果。
引用
@article{arxiv.2109.11321,
title = {Transferring Knowledge from Vision to Language: How to Achieve it and how to Measure it?},
author = {Tobias Norlund and Lovisa Hagström and Richard Johansson},
journal= {arXiv preprint arXiv:2109.11321},
year = {2021}
}