中文

TSE-PI:利用音高信息在混响环境下进行目标声音提取

声音 2024-06-14 v1 音频与语音处理

摘要

目标声音提取(TSE)根据提供的线索从混合信号中分离出目标声音。然而,现有模型在混响条件下的性能会显著下降。受听觉场景分析(ASA)的启发,本文提出了一种提供音高信息的TSE模型,命名为TSE-PI。通过使用特征级线性调制层和声音类别标签实现条件音高提取。采用结合音高信息的改进Waveformer模型,并使用可学习的Gammatone滤波器组替代卷积编码器,用于目标声音提取。引入音高信息旨在提升模型性能。在FSD50K数据集上的实验结果表明,当结合音高信息和Gammatone滤波器组时,在混响环境下的目标声音提取性能提升了2.4 dB。

关键词

引用

@article{arxiv.2406.08716,
  title  = {TSE-PI: Target Sound Extraction under Reverberant Environments with Pitch Information},
  author = {Yiwen Wang and Xihong Wu},
  journal= {arXiv preprint arXiv:2406.08716},
  year   = {2024}
}

备注

Accepted by Interspeech2024