LibriConvo:基于听者感知对话模拟的语料库,用于语音识别与说话人定位
音频与语音处理
2025-10-28 v1 计算与语言
声音
摘要
我们介绍 LibriConvo,这是一个基于听者感知对话模拟(SASC)构建的模拟多说话人对话语料库,旨在支持语音识别(ASR)和说话人定位系统的训练与评估。不同于以往依赖大多数语义上不相连的语料片段和不切实际的时间间隔的资源,LibriConvo 确保了语义连贯性和真实的对话时序。我们的管道链采用 CallHome 语料并结合外部 VAD 以获得可靠的边界,通过压缩处理减少不自然的长时间沉默,并按书籍组织 LibriTTS 的语料,以保持情境一致性。通过一种新颖的房间脉冲响应选择程序增强声学真实性,该程序按空间合理性对说话人-麦克风配置进行排序,在真实性与多样性之间进行平衡。该语料库覆盖 240.1 小时,包含 1,496 场对话,涉及 830 位独特说话人,以说话人无关的方式进行划分,以确保评估的稳健性。基线实验表明,SortFormer 模型在说话人定位方面优于 pyannote 流程,而经微调的 Fast Conformer-CTC XLarge 采用序列化输出训练方式在 ASR 上实现 7.29% 的 WER,超越了零样本 Whisper-large-v3。LibriConvo 提供了一个宝贵的资源,推动多说话人语音处理研究的发展,具有真实的对话动态和可控的实验条件。
引用
@article{arxiv.2510.23320,
title = {LibriConvo: Simulating Conversations from Read Literature for ASR and Diarization},
author = {Máté Gedeon and Péter Mihajlik},
journal= {arXiv preprint arXiv:2510.23320},
year = {2025}
}
备注
Submitted to LREC 2026