面向含噪语音的端到端语音识别的连续测试时自适应
音频与语音处理
2024-10-04 v2 声音
摘要
基于深度学习的端到端自动语音识别(ASR)取得了显著进展,但由于真实场景中的域偏移,在处理域外样本时仍然表现不佳。测试时自适应(TTA)方法通过在推理时使用测试样本调整模型来解决这个问题。然而,当前的 ASR TTA 方法主要关注非连续 TTA,与连续 TTA 相比,这限制了跨样本知识学习。在这项工作中,我们首先为 ASR 提出了一个快慢 TTA 框架,该框架利用了连续和非连续 TTA 的优势。遵循此框架,我们引入了 Dynamic SUTA(DSUTA),一种基于熵最小化的 ASR 连续 TTA 方法。为了增强 DSUTA 对时变数据的鲁棒性,我们设计了一种动态重置策略,以自动检测域偏移并重置模型,使其更有效地处理多域数据。我们的方法在各种含噪 ASR 数据集上展示了优越的性能,优于非连续和连续 TTA 基线,同时在不需域边界信息的情况下保持了对域变化的鲁棒性。
引用
@article{arxiv.2406.11064,
title = {Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech},
author = {Guan-Ting Lin and Wei-Ping Huang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2406.11064},
year = {2024}
}
备注
Accepted by EMNLP 2024