说话人活动驱动的神经语音提取
音频与语音处理
2021-02-11 v2 声音
摘要
目标语音提取旨在根据辅助说话人线索从混合语音中提取目标说话人的语音,近来受到越来越多的关注。已有研究探索了多种线索,如预先录制的注册语音、方向信息或目标说话人的视频。在本文中,我们探索使用说话人活动信息作为基于单通道神经网络的语音提取的辅助线索。我们提出了一种说话人活动驱动的语音提取神经网络(ADEnet),并表明其可在无需预录音的情况下达到与基于注册语音的方法相竞争的性能水平。我们进一步展示了所提方法处理会议式录音的潜力,其中说话人活动由 diarization(说话人日志)系统获得。我们表明这种简单而实用的方法能在 diarization 后成功提取说话人,从而改善 ASR(自动语音识别)性能,尤其在高度重叠条件下,相对词错误率降低高达 25%。
引用
@article{arxiv.2101.05516,
title = {Speaker activity driven neural speech extraction},
author = {Marc Delcroix and Katerina Zmolikova and Tsubasa Ochiai and Keisuke Kinoshita and Tomohiro Nakatani},
journal= {arXiv preprint arXiv:2101.05516},
year = {2021}
}
备注
To appear in ICASSP 2021