OpenViDial:一个具有视觉语境的大规模开放域对话数据集
计算与语言
2021-06-01 v2
摘要
人类交谈时,说话者接下来要说什么在很大程度上取决于他所看到的内容。遗憾的是,现有对话模型仅基于先前的文本语境来生成对话话语,很少考虑视觉语境。这是由于缺乏一个将话语与视觉语境配对的大规模多模态对话数据集。在本文中,我们发布了一个大规模多模态对话数据集 {\bf OpenViDial}。对话轮次与视觉语境提取自电影和电视剧,其中每个对话轮次都与其发生时的相应视觉语境配对。OpenViDial 共包含 110 万轮对话,因此也包含以图像形式存储的 110 万条视觉语境。基于该数据集,我们提出了一系列利用文本与视觉语境的编码器-解码器模型,从 CNN 提取的粗粒度图像特征到 Faster R-CNN 提取的细粒度目标特征。我们观察到视觉信息显著提升了对话生成质量,验证了融合多模态特征进行对话学习的必要性。我们的工作标志着向大规模多模态对话学习迈出的重要一步。
引用
@article{arxiv.2012.15015,
title = {OpenViDial: A Large-Scale, Open-Domain Dialogue Dataset with Visual Contexts},
author = {Yuxian Meng and Shuhe Wang and Qinghong Han and Xiaofei Sun and Fei Wu and Rui Yan and Jiwei Li},
journal= {arXiv preprint arXiv:2012.15015},
year = {2021}
}
备注
Dataset, visual features and code are found at https://github.com/ShannonAI/OpenViDial