中文

Re-ViLM:用于零样本与少样本图像描述的检索增强视觉语言模型

计算机视觉与模式识别 2023-10-24 v2 人工智能 计算与语言 信息检索 机器学习

摘要

将预训练语言模型(LMs)与视觉编码器(如 Flamingo)相结合,已在图像到文本生成中取得最优结果。然而,这些模型将所有知识存储于参数内部,因而常需庞大模型参数以建模海量视觉概念与丰富文本描述。此外,它们整合新数据的效率低下,需计算昂贵的微调过程。本工作中,我们提出基于 Flamingo 构建的检索增强视觉语言模型 Re-ViLM,支持从外部数据库检索相关知识,用于零样本与上下文少样本图像到文本生成。通过在外部数据库中显式存储特定知识,我们的方法减少了模型参数量,并可在评估时通过简单更新数据库轻松容纳新数据。我们还构建了交错图像与文本数据,以促进上下文少样本学习能力。我们证明 Re-ViLM 显著提升了图像到文本生成任务性能,尤其在域外设定下的零样本与少样本生成中,以相比基线方法少 4 倍的参数取得更好表现。

关键词

引用

@article{arxiv.2302.04858,
  title  = {Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning},
  author = {Zhuolin Yang and Wei Ping and Zihan Liu and Vijay Korthikanti and Weili Nie and De-An Huang and Linxi Fan and Zhiding Yu and Shiyi Lan and Bo Li and Ming-Yu Liu and Yuke Zhu and Mohammad Shoeybi and Bryan Catanzaro and Chaowei Xiao and Anima Anandkumar},
  journal= {arXiv preprint arXiv:2302.04858},
  year   = {2023}
}

备注

Findings of EMNLP 2023