KM-BART:用于视觉常识生成的知识增强多模态 BART
计算与语言
2021-07-19 v2
摘要
我们提出知识增强多模态 BART (KM-BART),这是一个基于 Transformer 的序列到序列模型,能够从图像与文本的多模态输入中推理常识知识。我们将生成式 BART 架构适配为具有视觉与文本输入的多模态模型。我们进一步开发了新颖的预训练任务以提升模型在视觉常识生成 (VCG) 任务上的表现。特别地,我们基于知识的常识生成 (KCG) 预训练任务通过利用在外部常识知识图上预训练的大型语言模型的常识知识,提升了模型在 VCG 任务上的性能。据我们所知,我们是首个提出专门任务以提升模型在 VCG 任务上表现的团队。实验结果表明,通过应用这些新颖的预训练任务,我们的模型在 VCG 任务上达到了最先进 (SOTA) 性能。
引用
@article{arxiv.2101.00419,
title = {KM-BART: Knowledge Enhanced Multimodal BART for Visual Commonsense Generation},
author = {Yiran Xing and Zai Shi and Zhao Meng and Gerhard Lakemeyer and Yunpu Ma and Roger Wattenhofer},
journal= {arXiv preprint arXiv:2101.00419},
year = {2021}
}
备注
ACL-IJCNLP 2021 main conference. The first three authors contribute equally to this work