利用局部时间反转语音进行自动语音识别的数据增强
音频与语音处理
2021-10-12 v1 声音
摘要
心理声学研究表明,局部时间反转(LTR)语音,即短片段内样本时间反转的语音,可被人类听者准确识别。本研究探讨最先进的自动语音识别(ASR)系统在 LTR 语音上的表现如何。其根本目标是探索在端到端(E2E)ASR 模型训练中使用 LTR 语音的可行性,作为改善识别性能的数据增强尝试。研究从理解 LTR 语音对通用 ASR 影响的实验开始。我们生成并评估了反转片段时长为 5 ms - 50 ms 的 LTR 语音。对于用 LTR 语音进行 ASR 训练数据增强,训练集由自然语音与不同比例的 LTR 语音组合创建。数据增强的有效性通过在多种语言与说话风格的语音语料上的 ASR 结果得到证实。发现反转片段时长为 15 ms - 30 ms 的 LTR 语音的 ASR 错误率低于其他片段时长。利用这些 LTR 语音的数据增强在 ASR 性能上取得了令人满意且一致的提升。
引用
@article{arxiv.2110.04511,
title = {Data Augmentation with Locally-time Reversed Speech for Automatic Speech Recognition},
author = {Si-Ioi Ng and Tan Lee},
journal= {arXiv preprint arXiv:2110.04511},
year = {2021}
}
备注
Submitted to ICASSP 2022