WASE:鸡尾酒会环境下用于说话人提取的注意力时机学习
音频与语音处理
2021-06-15 v1 人工智能
声音
信号处理
摘要
在说话人提取问题中,研究发现来自目标说话人的额外信息有助于对目标说话人的跟踪与提取,包括声纹、唇动、面部表情和空间信息。然而,无人关注声音起音这一线索,而该线索在听觉场景分析与心理学中已被强调。受此启发,我们显式地对起音线索进行建模,并验证了其在说话人提取任务中的有效性。我们进一步扩展到起音/止音线索,获得了性能提升。从任务角度看,我们基于起音/止音的模型完成了复合任务,即说话人提取与说话人相关语音活动检测的互补结合。我们还将声纹与起音/止音线索相结合。声纹对目标说话人的声音特征建模,而起音/止音对语音的起始/结束信息建模。从听觉场景分析角度看,两种感知线索的结合可促进听觉对象的完整性。实验结果也接近最先进(state-of-the-art)性能,且使用的参数近乎减半。我们希望本工作能启发语音处理与心理学领域,并促进二者之间的交流。我们的代码将发布于 https://github.com/aispeech-lab/wase/。
引用
@article{arxiv.2106.07016,
title = {WASE: Learning When to Attend for Speaker Extraction in Cocktail Party Environments},
author = {Yunzhe Hao and Jiaming Xu and Peng Zhang and Bo Xu},
journal= {arXiv preprint arXiv:2106.07016},
year = {2021}
}
备注
Accepted by ICASSP 2021