中文

MMChat:社交媒体上的多模态聊天数据集

计算与语言 2022-05-03 v3 计算机视觉与模式识别

摘要

在对话中融入多模态上下文对于开发更具吸引力的对话系统十分重要。本工作中,我们沿此方向引入 MMChat:一个大规模中文多模态对话语料库(32.4M 原始对话与 120.84K 过滤后对话)。不同于先前众包或采集自虚构电影的语料库,MMChat 包含从社交媒体真实对话中收集的图像接地对话,其中观察到稀疏性问题。具体而言,日常交流中由图像发起的对话可能随对话推进偏离至某些非图像接地的主题。为更好研究此问题,我们人工标注 MMChat 中的 100K 对话并据此进一步过滤语料,得到 MMChat-hf。我们开发了一个基准模型,通过在图像特征上适配注意力路由机制来解决对话生成任务中的稀疏性问题。实验证明了融入图像特征的有用性及处理图像特征稀疏性的有效性。

关键词

引用

@article{arxiv.2108.07154,
  title  = {MMChat: Multi-Modal Chat Dataset on Social Media},
  author = {Yinhe Zheng and Guanyi Chen and Xin Liu and Jian Sun},
  journal= {arXiv preprint arXiv:2108.07154},
  year   = {2022}
}

备注

Accepted by LREC2022. Dataset available in https://github.com/silverriver/MMChat