通过域不变嵌入变换实现语音增强的测试时自适应
音频与语音处理
2026-02-09 v1
摘要
基于深度学习的语音增强模型在测试分布与训练条件匹配时性能卓越,但在部署到存在域偏移的不可预测真实世界环境中时,性能往往会下降。为应对这一挑战,我们提出了 LaDen(潜在去噪),这是首个专为语音增强设计的测试时自适应方法。我们的方法利用强大的预训练语音表征进行潜在去噪,通过噪声嵌入的线性变换来逼近干净语音表征。我们证明,这种变换具有良好的跨域泛化能力,能够在没有目标域标注数据的情况下为目标域生成有效的伪标签。由此生成的伪标签使得语音增强模型能够在各种声学环境中进行有效的测试时自适应。我们提出了一个涵盖多个数据集、包含多种域偏移(包括噪声类型、说话人特征和语言的变化)的综合基准。大量实验表明,LaDen 在感知指标上始终优于基线方法,尤其是在说话人和语言域偏移方面。
引用
@article{arxiv.2509.04280,
title = {Test-Time Adaptation for Speech Enhancement via Domain Invariant Embedding Transformation},
author = {Tobias Raichle and Niels Edinger and Bin Yang},
journal= {arXiv preprint arXiv:2509.04280},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication