中文

FASA:用于提取高质量对齐儿童语音数据的灵活自动语音对齐器

计算与语言 2024-06-27 v1 声音 音频与语音处理

摘要

针对成人语音的自动语音识别 (ASR) 最近通过采用深度神经网络 (DNN) 模型取得了显著进展,但针对儿童语音的改进仍不理想,由于儿童语音的独特特征。预训练于成人数据上的 DNN 模型在对儿童语音进行微调时常常难以泛化,因为缺乏高质量对齐的儿童语音数据。生成数据集时,人工标注难以扩展,而现有的强制对齐工具因对输入转录文本质量的假设不切实际而无法使用。为此,我们提出了一种新的强制对齐工具 FASA,作为一种灵活的自动语音对齐器,用于从大量现有噪声儿童语音数据中提取高质量对齐儿童语音数据。我们在 CHILDES 数据集上演示了其用法,表明 FASA 可比人工标注提高数据质量 13.6 倍。

关键词

引用

@article{arxiv.2406.17926,
  title  = {FASA: a Flexible and Automatic Speech Aligner for Extracting High-quality Aligned Children Speech Data},
  author = {Dancheng Liu and Jinjun Xiong},
  journal= {arXiv preprint arXiv:2406.17926},
  year   = {2024}
}

备注

4 pages, 1 figure