面向对话语音识别的说话者感知模拟
声音
2026-02-05 v1 计算与语言
音频与语音处理
摘要
自动语音识别(ASR)用于对话语音仍面临挑战,主要由于大规模、经过良好注释的多说话者对话数据稀缺,以及自然交互中复杂的时间动力学。说话者感知模拟对话(SASC)作为有效的数据增强策略,通过将单说话者录音转换为逼真的多说话者对话来实现。然而,先前工作主要聚焦于英语数据,关于其对低资源语言的适用性存疑。本文针对匈牙利语对话语音识别,对 SASC 框架进行改造与实现。我们进一步提出 C-SASC,其扩展版本包含以言语时长为条件的停顿建模,使其能更忠实地代表人类对话中观察到的局部时间依赖,同时保留原方法的简单性和效率。我们从 BEA-Large 语料库生成合成匈牙利对话,并将其与真实对话数据组合用于 ASR 训练。对 SASC 和 C-SASC 在广泛的模拟配置下进行了大量评估,使用来自 CallHome、BEA-Dialogue 和 GRASS 语料库推导的对话统计信息。实验结果表明,说话者感知的对话模拟在新颖拼接式数据增强上持续改进了识别性能。虽然 C-SASC 在字符级错误率等指标上虽仅提升有限但系统性地,但其效果取决于源对话统计信息与目标域之间的匹配程度。总体而言,我们的发现确认了说话者感知对话模拟在匈牙利语 ASR 中的鲁棒性,并突显了日益详细的时间建模在合成对话生成中的优势与局限。
引用
@article{arxiv.2602.04776,
title = {Speaker-Aware Simulation Improves Conversational Speech Recognition},
author = {Máté Gedeon and Péter Mihajlik},
journal= {arXiv preprint arXiv:2602.04776},
year = {2026}
}