Z-LaVI:由视觉想象驱动的零样本语言求解器
计算与语言
2022-10-25 v1 计算机视觉与模式识别
摘要
大规模预训练语言模型在解决下游语言理解任务方面取得了显著进展。然而,它们通常受到报告偏差的困扰,即书面文本中缺乏显式常识知识的现象,例如“橘子是橙色的”。为克服这一限制,我们开发了一种新方法 Z-LaVI,赋予语言模型视觉想象能力。具体而言,我们利用两类互补的“想象”:(i)通过检索回忆现有图像,以及(ii)通过文本到图像生成合成不存在的图像。联合利用语言输入与想象,预训练视觉-语言模型(如 CLIP)最终为原始语言任务组合出零样本解决方案。值得注意的是,以想象为语言模型赋能可有效利用视觉知识来解决纯语言任务。因此,Z-LaVI 在多种语言任务上一致地提升了现有语言模型的零样本性能。
引用
@article{arxiv.2210.12261,
title = {Z-LaVI: Zero-Shot Language Solver Fueled by Visual Imagination},
author = {Yue Yang and Wenlin Yao and Hongming Zhang and Xiaoyang Wang and Dong Yu and Jianshu Chen},
journal= {arXiv preprint arXiv:2210.12261},
year = {2022}
}
备注
EMNLP 2022