推进野外声学测试场景下的测试时自适应
声音
2024-10-08 v2 机器学习
音频与语音处理
摘要
为自动语音识别(ASR)微调的声学基础模型,在真实场景的野外声学测试设置中部署时会出现性能退化。在此类条件下稳定在线测试时自适应(TTA)仍是一个开放且未被探索的问题。现有野外视觉 TTA 方法常因高熵语音帧的独特特性而难以有效处理语音数据,这些帧即使包含关键语义内容也常被不可靠地过滤掉。此外,与静态视觉数据不同,语音信号遵循短期一致性,需要专门的自适应策略。本文中,我们提出一种专为 ASR 微调声学基础模型设计的新型野外声学 TTA 方法。我们的方法——置信度增强自适应,采用置信度感知权重方案进行帧级自适应,以避免过滤掉高熵帧中的关键信息。此外,我们在测试时优化中应用一致性正则化,以利用语音信号固有的短期一致性。我们在合成与真实世界数据集上的实验表明,我们的方法在各种野外声学测试设置(包括高斯噪声、环境声音、口音变异与歌唱语音)下均优于现有基线。
引用
@article{arxiv.2310.09505,
title = {Advancing Test-Time Adaptation in Wild Acoustic Test Settings},
author = {Hongfu Liu and Hengguan Huang and Ye Wang},
journal= {arXiv preprint arXiv:2310.09505},
year = {2024}
}
备注
Accepted to the EMNLP 2024