论合成ASR训练数据中对话时机的作用
音频与语音处理
2026-07-09 v1 人工智能
声音
摘要
合成多说话人对话被广泛用于训练对话自动语音识别(ASR)系统,但目前尚不清楚哪些时机属性使模拟数据最为有效。本文将对话时机作为可控训练变量进行研究,而不仅仅是将其视为需要重现的语料库统计量。我们使用从多个对话语料库估计的指数倾斜族对停顿和重叠时机分布进行参数化,然后通过拉丁超立方采样和多目标贝叶斯优化探索由此产生的四维参数空间。每个采样的时机配置用于生成模拟训练对话、训练ASR系统,并在匈牙利语对话语料库上评估拼接置换词错误率和字符错误率(cpWER和cpCER)。结果表明,下游ASR行为由诱导的时机统计量解释,而非直接由原始模拟器坐标或语料库邻近度解释。具体而言,更高的重叠暴露与更低的cpWER相关,而更长且更多变的间隙与更高的cpWER相关;cpCER遵循相同的趋势,但统计支持较弱。贝叶斯优化产生了适度的总体改进,但其主要价值在于分析:它产生了受控的时机干预,揭示了模拟对话训练数据中的重叠-间隙权衡。这些发现表明,真实的模拟应辅以与任务相关的重叠、间隙和时机变异性特征诊断。
引用
@article{arxiv.2607.08371,
title = {On the Role of Conversational Timing in Synthetic Training Data for ASR},
author = {Máté Gedeon and Péter Mihajlik},
journal= {arXiv preprint arXiv:2607.08371},
year = {2026}
}