ReSee:在开放域对话中通过细粒度视觉知识进行回应
计算与语言
2023-10-23 v2
摘要
将视觉知识融入纯文本对话系统已成为模仿人类思考、想象与交流方式的一个潜在方向。然而,现有的多模态对话系统要么受限于可用数据集的规模与质量,要么受限于粗粒度的视觉知识概念。为解决这些问题,我们提出了一种构建多模态对话的新范式,以及在该范式下从纯文本对话扩展得到的两个数据集(ReSee-WoW、ReSee-DD)。我们提出将视觉知识显式拆分为更细的粒度(“轮次级”与“实体级”)。为进一步提升增强视觉信息的准确性与多样性,我们从互联网或大型图像数据集中检索这些知识。为证明所提供的视觉知识的优越性与通用性,我们提出了一个简单而有效的框架 ReSee,通过模态拼接将视觉表示加入原始对话模型中。我们还针对不同的模型配置与视觉知识设置进行了大量实验与消融研究。经验性的、令人鼓舞的结果不仅证明了在实体级与轮次级引入视觉知识的有效性,也验证了所提模型 ReSee 在自动与人工评测上优于若干 SOTA 方法。通过利用文本与视觉知识,ReSee 能够生成带有真实世界视觉概念的信息丰富回复。我们的代码已发布于 https://github.com/ImKeTT/ReSee。
引用
@article{arxiv.2305.13602,
title = {ReSee: Responding through Seeing Fine-grained Visual Knowledge in Open-domain Dialogue},
author = {Haoqin Tu and Yitong Li and Fei Mi and Zhongliang Yang},
journal= {arXiv preprint arXiv:2305.13602},
year = {2023}
}
备注
15 pages, accepted to EMNLP 2023 (main)