中文

MemeCMD:一个自动生成的中文多轮对话数据集,包含上下文检索的表情包

计算与语言 2025-07-02 v1 人工智能

摘要

表情包在线上社交互动中广泛使用,提供鲜活、直观且常带幽默感的表达意图和情感的手段。现有的对话数据集主要局限于手动标注或纯文本对话,缺乏多模态互动所提供的表达力和情境细微差别。为此,我们引入 MemeCMD,一个自动生成的中文多轮对话数据集,包含上下文检索的表情包。我们的数据集将大规模 MLLM 标注的表情包库与跨多样化情境的双主体自动生成对话相结合。我们引入检索框架和自适应阈值,以确保表情包使用情境相关且自然地分散。实验表明,我们的方法在生成情境恰当且多样化的包含表情包对话方面有效,提供了一个可扩展且隐私保护的资源,用于推进多模态对话 AI。

关键词

引用

@article{arxiv.2507.00891,
  title  = {MemeCMD: An Automatically Generated Chinese Multi-turn Dialogue Dataset with Contextually Retrieved Memes},
  author = {Yuheng Wang and Xianhe Tang and Pufeng Huang},
  journal= {arXiv preprint arXiv:2507.00891},
  year   = {2025}
}