听、自适应、更低误词率:面向自动语音识别的无源单话语测试时自适应
音频与语音处理
2022-06-22 v2 计算与语言
声音
摘要
尽管基于深度学习的端到端自动语音识别(ASR)近年表现卓越,其在取自不同数据分布的测试样本上会出现严重的性能退化。测试时自适应(TTA)此前在计算机视觉领域被探讨,旨在将源域训练的模型自适应以对常属域外的测试样本给出更好预测,且无需访问源数据。此处,我们提出面向ASR的单话语测试时自适应(SUTA)框架,据我们所知这是首个ASR的TTA研究。单话语TTA是一种更实际的设定,其不假设测试数据采样自同一分布,且不会因收集自适应数据批而延迟按需推理。SUTA由无监督目标与高效自适应策略构成。实证结果表明,SUTA有效提升了源ASR模型在多个域外目标语料及域内测试样本上的性能。
引用
@article{arxiv.2203.14222,
title = {Listen, Adapt, Better WER: Source-free Single-utterance Test-time Adaptation for Automatic Speech Recognition},
author = {Guan-Ting Lin and Shang-Wen Li and Hung-yi Lee},
journal= {arXiv preprint arXiv:2203.14222},
year = {2022}
}
备注
Accepted by Interspeech 2022