用于远场说话人验证的语音感知说话人嵌入
声音
2023-11-28 v1 人工智能
音频与语音处理
摘要
当说话人验证(SV)系统远离声源工作时,由于噪声与混响的干扰会产生显著挑战。研究表明,将语音信息融入说话人嵌入可改善文本无关 SV 的性能。受此启发,我们提出一种联合训练语音识别与说话人识别(JTSS)框架,以利用语音内容服务于远场 SV。该框架通过匹配说话人嵌入网络的基于帧的特征图与 wav2vec 的向量,鼓励说话人嵌入保留语音信息。其直觉在于,语音信息可保留含说话人信息的低层声学动态,从而部分补偿噪声与混响导致的退化。结果显示,所提框架在 VOiCES Challenge 2019 评测集与 VoxCeleb1 测试集上均优于标准说话人嵌入。这表明在远场条件下利用语音信息对于学习鲁棒说话人表征是有效的。
引用
@article{arxiv.2311.15627,
title = {Phonetic-aware speaker embedding for far-field speaker verification},
author = {Zezhong Jin and Youzhi Tu and Man-Wai Mak},
journal= {arXiv preprint arXiv:2311.15627},
year = {2023}
}
备注
submitted to ICASSP2024