检索、描述、生成:视觉接地以增强文本生成模型中的常识
计算与语言
2022-03-28 v3 人工智能
机器学习
摘要
我们研究了利用图像中包含的多模态信息作为增强 Transformer 文本生成模型常识的有效方法。我们使用 BART 和 T5 在概念到文本生成上进行了实验,具体任务是生成式常识推理,即 CommonGen。我们将我们的方法称为 VisCTG:视觉接地的概念到文本生成。VisCTG 涉及为描绘适当日常场景的图像生成描述,并使用这些描述来丰富和引导生成过程。全面的评估和分析表明,VisCTG 显著提高了模型性能,同时成功解决了基线生成的若干问题,包括常识性差、流畅性不足和特异性缺乏。
引用
@article{arxiv.2109.03892,
title = {Retrieve, Caption, Generate: Visual Grounding for Enhancing Commonsense in Text Generation Models},
author = {Steven Y. Feng and Kevin Lu and Zhuofu Tao and Malihe Alikhani and Teruko Mitamura and Eduard Hovy and Varun Gangal},
journal= {arXiv preprint arXiv:2109.03892},
year = {2022}
}
备注
Accepted to AAAI 2022. Code at https://github.com/styfeng/VisCTG