利用自监督学习语音表征改进多说话人环境下的注意选择解码
音频与语音处理
2023-02-14 v1 声音
信号处理
摘要
听觉注意解码(AAD)是一种用于在噪声环境中识别并放大听者所关注的说话人的技术。其做法是将听者的脑波与所有声源的某种表征进行比较,以找到最匹配者。该表征通常为声音的波形或谱图。这些表征用于AAD的有效性尚不确定。在本研究中,我们考察了自监督学习语音表征在提升AAD准确率和速度方面的应用。我们采用侵入式皮层脑电(ECoG)记录了三名受试者在聆听两段对话并专注于其中一段时的脑活动。我们使用WavLM提取每位说话人的潜在表征,并训练了一个时空滤波器将脑活动映射到语音的中间表征。在评估阶段,将重建的表征与每位说话人的表征进行比较以确定目标说话人。我们的结果表明,来自WavLM的语音表征比语音包络和谱图具有更好的解码准确率和速度。我们的发现展示了自监督学习语音表征用于听觉注意解码的优势,并为开发脑控可听戴技术铺平了道路。
引用
@article{arxiv.2302.05756,
title = {Improved Decoding of Attentional Selection in Multi-Talker Environments with Self-Supervised Learned Speech Representation},
author = {Cong Han and Vishal Choudhari and Yinghao Aaron Li and Nima Mesgarani},
journal= {arXiv preprint arXiv:2302.05756},
year = {2023}
}