基于测试时训练的语音增强
音频与语音处理
2025-10-21 v2 机器学习
声音
摘要
本文介绍了一种 novel 的测试时训练 (Test-Time Training, TTT) 方法用于语音增强,旨应对不可预测的噪声条件和领域迁移带来的挑战。该方法以 Y 形架构将主要语音增强任务与自监督辅助任务相结合。在推理阶段,模型通过优化如噪声增强信号重建或掩码频谱预测等自监督任务,实现对新领域的动态适应,从而无需标签数据。我们进一步引入了各种 TTT 策略,在适应性和效率之间提供权衡。跨合成数据集和真实世界数据集的评估表明,该方法在语音质量指标上 consistently 获益,超越基线模型。本工作凸显了 TTT 在语音增强中的有效性,为未来在自适应和鲁棒语音处理研究提供了启示。
引用
@article{arxiv.2508.01847,
title = {Test-Time Training for Speech Enhancement},
author = {Avishkar Behera and Riya Ann Easow and Venkatesh Parvathala and K. Sri Rama Murty},
journal= {arXiv preprint arXiv:2508.01847},
year = {2025}
}
备注
Published in the Proceedings of Interspeech 2025