中文

基于可微跟踪的深度学习方法声源定位器训练

音频与语音处理 2021-11-02 v1 声音

摘要

基于数据与基于学习的声源定位(SSL)在挑战性条件下已展现出有前景的结果,通常被设为分类或回归问题。基于回归的方法相较基于分类的方法具有一定优势,例如对静态与运动声源进行连续波达方向估计。然而,多声源场景需要多个回归器,且迄今缺乏不依赖声源同时分类等辅助信息的明确训练策略。我们借助一种近期为视频目标检测器提出并适配至 SSL 设置的技术,研究此类方法的端到端训练。构建了一个可插在定位器输出上的可微网络,以解决预测与参考之间的最优分配,直接优化流行的 CLEAR-MOT 跟踪度量。结果表明,在定位误差、检测度量与跟踪能力方面,相较直接优化均方误差有大幅改进。

关键词

引用

@article{arxiv.2111.00030,
  title  = {Differentiable Tracking-Based Training of Deep Learning Sound Source Localizers},
  author = {Sharath Adavanne and Archontis Politis and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2111.00030},
  year   = {2021}
}

备注

Submitted to IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA2021)