通过特征蒸馏从双耳音频学习鲁棒的空间表征
声音
2025-08-29 v1 机器学习
音频与语音处理
摘要
最近,深度表征学习在多个音频任务中显示出强大的性能。然而,其用于从多通道音频学习空间表征的应用仍未得到广泛探索。我们研究了基于特征蒸馏的预训练方法,以无需数据标签的方式学习双耳语音的鲁棒空间表征。在此框架下,计算来自干净双耳语音样本的空间特征以形成预测标签。这些干净特征随后从对应的增强语音中进行预测。预训练后,我们丢弃空间特征预测器,使用所学的编码器权重初始化指向估计模型(DoA),并对其进行微调以进行 DoA 估计。我们的实验表明,预训练模型在噪声和混响环境中进行 DoA 估计微调后,表现优于完全监督模型和经典信号处理方法。
引用
@article{arxiv.2508.20914,
title = {Learning Robust Spatial Representations from Binaural Audio through Feature Distillation},
author = {Holger Severin Bovbjerg and Jan Østergaard and Jesper Jensen and Shinji Watanabe and Zheng-Hua Tan},
journal= {arXiv preprint arXiv:2508.20914},
year = {2025}
}
备注
To appear in Proc. WASPAA 2025, October 12-15, 2025, Tahoe, US. Copyright (c) 2025 IEEE. 5 pages, 2 figures, 2 tables