RealTalk-CN:基于跨模态互动分析的现实中文语音文本对话基准
计算与语言
2025-08-15 v1
摘要
近年来,大型语言模型(Large Language Models, LLMs)在多模态处理方面取得了显著进展,包括实现自然交互并执行特定任务的端到端语音语言模型。然而,现有的任务导向对话(Task-Oriented Dialogue, TOD)数据集主要是文本基准,缺乏真实语音信号,难以评估基于语音的LLMs的鲁棒性。此外,现有的语音TOD数据集主要是英文,缺乏语音不连贯性和说话者差异等关键方面。为填补这些差距,我们引入RealTalk-CN,首个包含5.4k个对话(60K句话,150小时)的人造中文多轮、多域语音文本双模态TOD数据集。RealTalk-CN捕获多样化对话场景,标注了自发语音不连贯性,确保对语音对话中实际世界复杂性的全面覆盖。此外,我们提出一种新颖的跨模态聊天任务,真实模拟现实世界用户交互,允许在语音和文本模式之间动态切换。我们的评估涵盖语音不连贯性鲁棒性、说话者特征敏感性和跨域性能。广泛的实验验证了RealTalk-CN的有效性,为中文语音LLMs研究奠定了坚实基础。
引用
@article{arxiv.2508.10015,
title = {RealTalk-CN: A Realistic Chinese Speech-Text Dialogue Benchmark With Cross-Modal Interaction Analysis},
author = {Enzhi Wang and Qicheng Li and Shiwan Zhao and Aobo Kong and Jiaming Zhou and Xi Yang and Yequan Wang and Yonghua Lin and Yong Qin},
journal= {arXiv preprint arXiv:2508.10015},
year = {2025}
}
备注
9 pages