中文

重要性加权域适应用于声源跟踪

音频与语音处理 2025-09-17 v1

摘要

近年来,深度学习显著推动了声源定位(Sound Source Localization, SSL)技术发展。然而,这些模型需要大量标注数据,而实际录音在若干情况下难以标注,尤其是当声源运动时。合成数据使用模拟房间脉冲响应(Room Impulse Responses, RIRs)和噪声提供了实用替代方案,但在实际环境中训练的模型因领域迁移问题表现不佳。无监督域适应(Unsupervised Domain Adaptation, UDA)可通过无需后者标注的方式对齐合成与真实领域,但现有方法仅关注静态SSL,未考虑声源跟踪(Sound Source Tracking, SST)这一具体问题。SST存在两个特定域适应挑战:其一,变长输入序列在特征维度上跨域不匹配;其二,合成数据与真实数据的角度覆盖范围可能因部分领域重叠或批量大小限制而未对齐,称之为方向多样性不匹配。为此,我们提出一种专为SST设计的UDA方法,基于两个关键特性。我们采用循环神经网络的最终隐藏状态作为固定维度特征表示以处理变长序列。进一步使用重要性加权对抗训练以处理方向多样性不匹配,优先选择与真实领域相似的合成样本。实验结果表明,我们的方法成功地将合成训练的模型适配至真实环境,显著提升SST性能。

关键词

引用

@article{arxiv.2509.13215,
  title  = {Importance-Weighted Domain Adaptation for Sound Source Tracking},
  author = {Bingxiang Zhong and Thomas Dietzen},
  journal= {arXiv preprint arXiv:2509.13215},
  year   = {2025}
}

备注

Accepted paper: Workshop on Detection and Classification of Acoustic Scenes and Events (DCASE 2025)