中文

面向参考引导的目标声检测的共享表征学习

音频与语音处理 2026-03-19 v1 人工智能

摘要

人类听众展现出从复杂声学场景中选择性分离所需声音的惊人能力,这激励了针对目标声检测(TSD)的研究。该任务要求在提供目标声参考音频的情况下检测和定位目标声。先前方法依赖于为参考音生成声学判别性条件嵌入向量,并将其与混合音编码器配对,联合优化多任务学习方法。在本工作中,我们提出了一种统一的编码器架构,在共享表征空间中处理参考音和混合音,以促进更强的对齐并降低架构复杂度。这种设计不仅简化了整个框架,也增强了对未见类的泛化。遵循多任务训练范式,我们的方法在先前方法之上取得了显著的改进,超过了现有方法,在URBAN-SED数据集上实现了83.15%的段落F1得分和95.17%的整体准确率,达到新的状态-最佳基准。

关键词

引用

@article{arxiv.2603.17025,
  title  = {Shared Representation Learning for Reference-Guided Targeted Sound Detection},
  author = {Shubham Gupta and Adarsh Arigala and B. R. Dilleswari and Sri Rama Murty Kodukula},
  journal= {arXiv preprint arXiv:2603.17025},
  year   = {2026}
}

备注

Accepted to IEEE ICASSP 2026