TSE-PI:利用音高信息在混响环境下进行目标声音提取
声音
2024-06-14 v1 音频与语音处理
摘要
目标声音提取(TSE)根据提供的线索从混合信号中分离出目标声音。然而,现有模型在混响条件下的性能会显著下降。受听觉场景分析(ASA)的启发,本文提出了一种提供音高信息的TSE模型,命名为TSE-PI。通过使用特征级线性调制层和声音类别标签实现条件音高提取。采用结合音高信息的改进Waveformer模型,并使用可学习的Gammatone滤波器组替代卷积编码器,用于目标声音提取。引入音高信息旨在提升模型性能。在FSD50K数据集上的实验结果表明,当结合音高信息和Gammatone滤波器组时,在混响环境下的目标声音提取性能提升了2.4 dB。
引用
@article{arxiv.2406.08716,
title = {TSE-PI: Target Sound Extraction under Reverberant Environments with Pitch Information},
author = {Yiwen Wang and Xihong Wu},
journal= {arXiv preprint arXiv:2406.08716},
year = {2024}
}
备注
Accepted by Interspeech2024