中文

学习用贴纸回复:一种统一多轮对话中多模态的框架

计算与语言 2020-03-11 v1 计算机视觉与模式识别 多媒体

摘要

具有生动且引人入胜表情的贴纸在在线通讯应用中日益流行,一些工作致力于通过将贴纸的文本标签与前序话语匹配来自动选择贴纸回复。然而,由于贴纸数量庞大,为所有贴纸要求文本标签并不现实。因此,本文提出基于多轮对话上下文历史,在无需任何外部标签的情况下向用户推荐合适贴纸。该任务面临两个主要挑战:一是无对应文本标签时学习贴纸语义;二是将候选贴纸与多轮对话上下文联合建模。为应对这些挑战,我们提出贴纸回复选择器(SRS)模型。具体而言,SRS 首先采用基于卷积的贴纸图像编码器和基于自注意力的多轮对话编码器获取贴纸与话语的表示;接着提出深度交互网络,在贴纸与对话历史中每条话语间进行深度匹配;随后 SRS 通过融合网络学习所有交互结果的短期与长期依赖,输出最终匹配分数。为评估所提方法,我们从最流行的在线聊天平台之一收集了带贴纸的大规模真实对话数据集。在该数据集上的大量实验表明,我们的模型在所有常用指标上均达到 SOTA 性能;实验也验证了 SRS 各组件的有效性。为促进贴纸选择领域的进一步研究,我们发布了该包含 340K 多轮对话与贴纸对的数据集。

关键词

引用

@article{arxiv.2003.04679,
  title  = {Learning to Respond with Stickers: A Framework of Unifying Multi-Modality in Multi-Turn Dialog},
  author = {Shen Gao and Xiuying Chen and Chang Liu and Li Liu and Dongyan Zhao and Rui Yan},
  journal= {arXiv preprint arXiv:2003.04679},
  year   = {2020}
}

备注

Accepted by The Web Conference 2020 (WWW 2020). Equal contribution from first two authors. Dataset and code are released at https://github.com/gsh199449/stickerchat