中文

基于测试时训练的语音增强

音频与语音处理 2025-10-21 v2 机器学习 声音

摘要

本文介绍了一种 novel 的测试时训练 (Test-Time Training, TTT) 方法用于语音增强,旨应对不可预测的噪声条件和领域迁移带来的挑战。该方法以 Y 形架构将主要语音增强任务与自监督辅助任务相结合。在推理阶段,模型通过优化如噪声增强信号重建或掩码频谱预测等自监督任务,实现对新领域的动态适应,从而无需标签数据。我们进一步引入了各种 TTT 策略,在适应性和效率之间提供权衡。跨合成数据集和真实世界数据集的评估表明,该方法在语音质量指标上 consistently 获益,超越基线模型。本工作凸显了 TTT 在语音增强中的有效性,为未来在自适应和鲁棒语音处理研究提供了启示。

关键词

引用

@article{arxiv.2508.01847,
  title  = {Test-Time Training for Speech Enhancement},
  author = {Avishkar Behera and Riya Ann Easow and Venkatesh Parvathala and K. Sri Rama Murty},
  journal= {arXiv preprint arXiv:2508.01847},
  year   = {2025}
}

备注

Published in the Proceedings of Interspeech 2025