面向音视频多通道语音分离与识别的联合说话人特征学习
声音
2024-06-17 v1 音频与语音处理
摘要
本文提出了用于音视频多通道语音分离和识别系统的零样态适应的联合说话人特征学习方法。将xVector和ECAPA-TDNN说话人编码器通过专为此目的设计的融合模块紧密集成到完整系统训练中。在LRS3-TED数据集上进行的实验表明,模拟的多通道重叠语音表明,联合说话人特征学习在不进行联合说话人特征估计的基线方法上持续改进语音分离和识别性能。进一步的分析揭示,性能提升与使用余弦相似度衡量的说话人间判别性增加高度相关。经过集成WavLM特征和视频模态后,最佳的联合说话人特征学习适应系统在Dev和Test集合上分别实现了21.6%和25.3%(相对降低67.5%和83.5%)的绝对WER reductions。
引用
@article{arxiv.2406.10152,
title = {Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition},
author = {Guinan Li and Jiajun Deng and Youjun Chen and Mengzhe Geng and Shujie Hu and Zhe Li and Zengrui Jin and Tianzi Wang and Xurong Xie and Helen Meng and Xunying Liu},
journal= {arXiv preprint arXiv:2406.10152},
year = {2024}
}
备注
Accepted by Interspeech 2024