DEBATE:通过语音消解中文文本歧义的数据集
计算与语言
2025-06-10 v1
摘要
尽管在文本和视觉消解方面进行了广泛的研究,但通过语音消解(Speech-based Disambiguation, DTS)仍鲜有探索。这主要是由于缺乏将 spoken sentences 与富含歧义 text 配对的高质量数据集。为此,我们提出DEBATE,一个独特的公开中文语音-文本数据集,用于研究语音线索和模式——发音、停顿、重音和语调——如何帮助消解文本歧义并揭示说话者的真实意图。DEBATE包含1001个精心挑选的含歧义语音,每个语音由10名母语者录制,捕捉 diverse linguistic歧义及其通过语音的消解。我们详细描述了数据收集管道并提供严格的质量分析。此外,我们对三个最先进的大型语音和音频语言模型进行基准测试,说明机器与人类对 spoken intent 理解之间的巨大差距。DEBATE是首个此类数据集,为跨语言和文化构建类似DTS数据集提供了基础。数据集和相关代码均可于https://github.com/SmileHnu/DEBATE获取。
引用
@article{arxiv.2506.07502,
title = {DEBATE: A Dataset for Disentangling Textual Ambiguity in Mandarin Through Speech},
author = {Haotian Guo and Jing Han and Yongfeng Tu and Shihao Gao and Shengfan Shen and Wulong Xiang and Weihao Gan and Zixing Zhang},
journal= {arXiv preprint arXiv:2506.07502},
year = {2025}
}