中文

通过前端适配网络提高 ASR 对数据包丢失的鲁棒性

声音 2024-06-28 v1 计算与语言 机器学习 音频与语音处理

摘要

在自动语音识别(ASR)领域,对噪声环境的鲁棒性仍是一个重要挑战。最近的 ASR 模型,如 Whisper,已显示出良好的潜力,但其在噪声条件下的效果仍可进一步提升。本研究旨在通过恢复数据包丢失来提高 ASR 模型的词错误率(WER)。我们提出使用一个连接在冻结的 ASR 模型前端的适配网络。该适配网络通过最小化 ASR 模型的准则以及增强损失函数来修改被破坏的输入频谱。我们的实验表明,该适配网络在数据包丢失场景下,针对 Whisper 的准则进行训练,可显著降低跨域和跨语言的词错误率。这种改进是在对 Whisper 模型基础性能影响最小的前提下实现的,凸显了该方法在实际应用中的可行性和提升 ASR 模型在挑战性声学环境中性能的潜力。

关键词

引用

@article{arxiv.2406.18928,
  title  = {Enhanced ASR Robustness to Packet Loss with a Front-End Adaptation Network},
  author = {Yehoshua Dissen and Shiry Yonash and Israel Cohen and Joseph Keshet},
  journal= {arXiv preprint arXiv:2406.18928},
  year   = {2024}
}

备注

Accepted for publication at INTERSPEECH 2024