中文

基于强化学习的多模态知识对齐

计算与语言 2022-05-26 v1 计算机视觉与模式识别

摘要

大语言模型即使在没有任务特定训练数据的情况下,也能轻松适应新场景。它们的零样本能力能否扩展到多模态输入?在本工作中,我们提出 ESPER,将仅语言模型的零样本模型扩展到未见过的多模态任务,如图像与音频描述生成。我们的关键创新在于使用强化学习在无直接监督的情况下将多模态输入与语言模型生成对齐:例如在图像情形下,我们的奖励优化仅依赖从 CLIP 导出的余弦相似度,因此不需要额外的显式配对(图像,描述)数据。由于语言模型的参数保持不变,该模型维持了其零样本泛化能力。实验表明,ESPER 在多种零样本任务上优于基线和已有工作;其中包括我们收集并发布的全新基准 ESP dataset,该数据集要求模型为每张图像生成若干风格多样的描述。

关键词

引用

@article{arxiv.2205.12630,
  title  = {Multimodal Knowledge Alignment with Reinforcement Learning},
  author = {Youngjae Yu and Jiwan Chung and Heeseung Yun and Jack Hessel and JaeSung Park and Ximing Lu and Prithviraj Ammanabrolu and Rowan Zellers and Ronan Le Bras and Gunhee Kim and Yejin Choi},
  journal= {arXiv preprint arXiv:2205.12630},
  year   = {2022}
}