中文

KwaiChat:一个大规模视频驱动的多语言混合类型对话语料库

计算与语言 2025-05-16 v2

摘要

基于视频的对话系统(如教育助手)具有引人注目的应用价值,因此引起了越来越多的关注。然而,当前的基于视频的对话系统受限于对单一对话类型的依赖,这阻碍了它们在包括问答、情感对话等在内的多种场景的实际应用中的通用性。在本文中,我们将这一挑战确定为如何生成视频驱动的多语言混合类型对话。为了缓解这一挑战,我们提出了一项新任务,并创建了一个由人机交互产生的视频驱动多语言混合类型对话语料库,称为 KwaiChat,该语料库包含总计 93,209 个视频和 246,080 个对话,涵盖 4 种对话类型、30 个领域、4 种语言和 13 个主题。此外,我们在 KwaiChat 上建立了基线模型。对 KwaiChat 上 7 个不同的 LLM 的广泛分析表明,GPT-4o 取得了最佳性能,但即使借助上下文学习和微调,在这种情况下仍然无法表现良好,这表明该任务并不简单,需要进一步研究。

关键词

引用

@article{arxiv.2503.06899,
  title  = {KwaiChat: A Large-Scale Video-Driven Multilingual Mixed-Type Dialogue Corpus},
  author = {Xiaoming Shi and Zeming Liu and Yiming Lei and Chenkai Zhang and Haitao Leng and Chuan Wang and Qingjie Liu and Wanxiang Che and Shaoguo Liu and Size Li and Yunhong Wang},
  journal= {arXiv preprint arXiv:2503.06899},
  year   = {2025}
}