通用无说话人嵌入的目标说话人提取与个人语音活动检测
音频与语音处理
2025-05-20 v2 声音
摘要
在现实应用中,确定“谁说了什么以及何时说的”仍然具有挑战性。在典型场景中,说话人日志用于解决“谁何时说话”的问题,而目标说话人提取或目标说话人自动语音识别技术用于解决“谁说了什么”的问题。尽管一些工作通过结合说话人日志和目标说话人提取系统取得了有希望的结果,但说话人日志和目标说话人提取之间在输出不一致和场景不匹配方面仍然存在不一致。为了解决这些局限性,我们提出了一种通用无说话人嵌入的目标说话人提取与个人语音活动检测模型,该模型联合执行目标说话人提取和个人语音活动检测。USEF-TP利用通过交叉注意力机制获得的帧级特征作为说话人相关特征,而不是像传统方法那样使用说话人嵌入。此外,应用了具有场景感知差异化损失函数的多任务学习算法,以确保在不同说话人重叠程度下具有鲁棒性能。实验结果表明,我们提出的USEF-TP模型在LibriMix和SparseLibriMix数据集上的目标说话人提取和个人语音活动检测任务中取得了优越性能。在CALLHOME数据集上的结果证明了我们的模型在真实录音上的竞争性能。
引用
@article{arxiv.2501.03612,
title = {Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection},
author = {Bang Zeng and Ming Li},
journal= {arXiv preprint arXiv:2501.03612},
year = {2025}
}
备注
Accepted by Computer Speech and Language (CSL)