E-BATS:面向语音基础模型的高效无反向传播测试时适应框架
机器学习
2026-02-24 v3 声音
音频与语音处理
摘要
语音基础模型在面临现实场景中的声学域迁移(如背景噪声和说话人方言)时,性能会显著下降。测试时适应(Test-Time Adaptation, TTA)最近作为一种在推理时解决此类域迁移的可行策略,无需访问源数据或标签。然而,现有 TTA 方法,尤其是依赖反向传播的方法,在内存占用上具有较大挑战,限制了其在语音任务和资源受限环境中的应用。尽管无反向传播的方法在效率方面更具优势,但现有方法在准确率上表现不佳。这主要是因为它们主要为视觉任务开发,而视觉任务的表述方式、噪声特性和模型架构与语音任务截然不同,带来了独特的可迁移性挑战。本文引入 E-BATS,即首个专为语音基础模型设计的高效无反向传播 TTA 框架。E-BATS 通过三个关键组件在适应性和内存效率之间取得平衡:(i)轻量级提示适应,用于基于前向传递的特征对齐;(ii)多尺度损失,捕获全局(说话单元级)和局部(标记级)分布迁移;(iii)测试时指数移动平均机制,用于跨说话单元实现稳定适应。在覆盖十六种声学条件的四个噪声语音数据集上进行的实验表明,方法始终能实现一致的改进,相较于无反向传播基线实现 4.1%-13.5% 的准确率提升,相较于基于反向传播的方法实现 2.0-6.4 倍的 GPU 内存节省。通过实现在声学可变性条件下的可扩展且稳健的适应,本工作为开发面向实际语音处理系统的更高效适应方法指明了方向。
引用
@article{arxiv.2506.07078,
title = {E-BATS: Efficient Backpropagation-Free Test-Time Adaptation for Speech Foundation Models},
author = {Jiaheng Dong and Hong Jia and Soumyajit Chatterjee and Abhirup Ghosh and James Bailey and Ting Dang},
journal= {arXiv preprint arXiv:2506.07078},
year = {2026}
}
备注
Accepted by NeurIPS 2025