中文

Multi-VQG:为多张图像生成引人入胜的问题

计算与语言 2022-11-21 v2 计算机视觉与模式识别 机器学习

摘要

生成引人入胜的内容近期在NLP社区引起了大量关注。提问是回应照片并促进关注的一种自然方式。然而,传统问答(QA)数据集中大多数问题的答案是事实型的,这降低了个体的回答意愿。此外,传统的视觉问题生成(VQG)将问题生成源数据限制为单张图像,导致理解底层事件时间序列信息的能力有限。在本文中,我们提出从多张图像生成引人入胜的问题。我们提出了MVQG这一新数据集,并建立了一系列基线,包括端到端和双阶段架构。结果表明,构建图像序列背后的故事使模型能够生成引人入胜的问题,这证实了我们的假设:人们在提问前通常会在脑海中构建事件的图景。这些结果为视觉与语言模型提出了一个令人兴奋的挑战,即隐式构建一系列照片背后的故事,以实现创造力和经验分享,从而吸引对下游应用的关注。

关键词

引用

@article{arxiv.2211.07441,
  title  = {Multi-VQG: Generating Engaging Questions for Multiple Images},
  author = {Min-Hsuan Yeh and Vicent Chen and Ting-Hao 'Kenneth' Haung and Lun-Wei Ku},
  journal= {arXiv preprint arXiv:2211.07441},
  year   = {2022}
}

备注

In Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing (EMNLP 2022)