迈向富有表现力的网络表情包交流:一个新的多模态对话数据集与基准
计算与语言
2021-09-07 v1 计算机视觉与模式识别
摘要
作为一种新型表达元素,网络表情包(Internet meme)因其能使对话生动、动人且有趣,而在在线聊天场景中广受欢迎并被广泛使用。然而,当前大多数对话研究聚焦于纯文本对话任务。本文提出一项新任务,命名为表情包融合开放域对话(Meme incorporated Open-domain Dialogue, MOD)。与以往对话任务相比,MOD 更具挑战性,因为它要求模型理解多模态元素及其背后的情感。为推进 MOD 研究,我们构建了一个大规模开放域多模态对话数据集,将丰富的网络表情包融入话语中。该数据集包含约 45K 条中文对话与约 606K 条话语。每条约含 13 条话语,平均含约 4 个网络表情包,且每条配有网络表情包的话语都标注了相应情感。此外,我们提出了一种简单有效的方法,利用统一生成网络求解 MOD 任务。实验结果表明,我们在所提语料上训练的方法能够实现包含文本与表情包的表现力交流。该语料与模型已公开于 https://github.com/lizekang/DSTC10-MOD。
引用
@article{arxiv.2109.01839,
title = {Towards Expressive Communication with Internet Memes: A New Multimodal Conversation Dataset and Benchmark},
author = {Zhengcong Fei and Zekang Li and Jinchao Zhang and Yang Feng and Jie Zhou},
journal= {arXiv preprint arXiv:2109.01839},
year = {2021}
}