Spoken DialogSum:面向口语对话摘要的富情感对话数据集
计算与语言
2025-12-19 v2 人工智能
机器学习
音频与语音处理
摘要
最近的音频语言模型可以跟随长对话。然而,关于情感感知或口语对话摘要的研究受到缺乏将语音、摘要和副语言线索联系起来的数据的制约。我们引入了Spoken DialogSum,这是第一个将原始对话音频与事实摘要、富情感摘要以及说话人年龄、性别和情感的语句级标签对齐的语料库。该数据集分两个阶段构建:第一阶段,一个LLM使用Switchboard风格的填充词和回溯短语重写DialogSum脚本,然后为每个语句标注情感、音高和语速。第二阶段,一个富有表现力的TTS引擎从标注后的脚本合成语音,并与副语言标签对齐。Spoken DialogSum包含13,460个情感多样的对话,每个对话都配有事实摘要和情感导向摘要。我们在线发布了一个演示页面(https://fatfat-emosum.github.io/EmoDialog-Sum-Audio-Samples/),并计划在未来发布完整数据集。基线实验表明,Audio-LLM相比级联ASR-LLM系统将情感摘要的ROUGE-L提升了28%,证实了端到端语音建模的价值。
引用
@article{arxiv.2512.14687,
title = {Spoken DialogSum: An Emotion-Rich Conversational Dataset for Spoken Dialogue Summarization},
author = {Yen-Ju Lu and Kunxiao Gao and Mingrui Liang and Helin Wang and Thomas Thebaud and Laureano Moro-Velazquez and Najim Dehak and Jesus Villalba},
journal= {arXiv preprint arXiv:2512.14687},
year = {2025}
}
备注
12 pages, 2 figures