中文

图像接地对话:面向自然问答生成的多模态上下文

计算与语言 2017-04-21 v2 人工智能 计算机视觉与模式识别

摘要

图像在社交媒体上的分享及其在用户之间产生的互动,反映了视觉上下文在日常对话中所扮演的重要角色。我们提出了一种新颖的任务——图像接地对话(IGC),即围绕共享图像生成听起来自然的对话。为基准测试进展,我们引入了一个由众包、以事件为中心的关于图像的对话构成的多参考数据集。IGC 位于闲聊与面向目标的对话模型之间的连续统上,其中视觉接地将对话主题约束为事件驱动的语句。在社交媒体数据上训练的模型实验表明,视觉与文本上下文的结合提升了生成对话轮次的质量。在人工评价中,人类表现与神经及检索架构两者之间的差距表明,多模态 IGC 对对话研究提出了有趣的挑战。

关键词

引用

@article{arxiv.1701.08251,
  title  = {Image-Grounded Conversations: Multimodal Context for Natural Question and Response Generation},
  author = {Nasrin Mostafazadeh and Chris Brockett and Bill Dolan and Michel Galley and Jianfeng Gao and Georgios P. Spithourakis and Lucy Vanderwende},
  journal= {arXiv preprint arXiv:1701.08251},
  year   = {2017}
}