中文

跨语言低资源ASR评测中数据划分策略研究

计算与语言 2022-08-30 v1 声音 音频与语音处理

摘要

许多自动语音识别(ASR)数据集包含一个预定义的测试集,由一名或多名其语音从未出现在训练集中的说话人组成。然而,这种“留出说话人”的数据划分策略,对于说话人数量极少的数据集可能并不理想。本研究针对五种ASR训练资源极少的语言,考察了十种不同的数据切分方法。我们发现:(1)模型性能因被选作测试的说话人不同而有很大差异;(2)所有留出说话人的平均词错误率(WER)不仅与多次随机划分的平均WER相当,也与任意给定的单个随机划分相当;(3)当数据按启发式或对抗式划分时,WER通常也相当;(4)无论数据如何划分,语句时长和强度都是导致变异的相对更具预测性的因素。这些结果表明,广泛使用的ASR数据划分留出说话人方法可能产生不能反映模型在未见数据或说话人上性能的结果。在面对数据稀疏时,随机划分可以产生更可靠且可泛化的估计。

关键词

引用

@article{arxiv.2208.12888,
  title  = {Investigating data partitioning strategies for crosslinguistic low-resource ASR evaluation},
  author = {Zoey Liu and Justin Spence and Emily Prud'hommeaux},
  journal= {arXiv preprint arXiv:2208.12888},
  year   = {2022}
}