基于自动说话人检测与表示的序列到序列神经说话人识别
音频与语音处理
2025-06-24 v2
摘要
本文提出了一种新的序列到序列神经说话人识别(S2SND)框架,用于执行在线和离线说话人识别。它源自我们先前目标说话人语音活动检测系统的序列到序列架构,并进一步演化为一种新的识别范式,通过解决两个关键问题实现。1) 说话人检测:所提出的方法可利用部分给定的说话人嵌入来发现未知说话人,并预测音频信号中的目标语音活动。它无需提前进行说话人登记即可工作。2) 说话人表示:所提出的方法可将预测的语音活动作为参考信息,同步从音频信号中提取说话人嵌入。说话人嵌入的表示空间将在整个识别网络中联合学习,无需额外的说话人嵌入模型。在推理阶段,S2SND 框架可对长音频记录进行分块处理。检测模块利用先前获取的说话人嵌入缓冲区,预测每个到来的音频块中已登记和未知说话人的语音活动。随后,根据表示模块的预测结果更新说话人嵌入缓冲区。假设在小块移动内最多出现一个新说话人,我们的模型会迭代预测每个块的结果,并为后续块提取目标嵌入,直至信号结束。最后,最后的说话人嵌入缓冲区可对整个音频进行重新评分,实现高度精确的识别性能。实验结果表明……
引用
@article{arxiv.2411.13849,
title = {Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation},
author = {Ming Cheng and Yuke Lin and Ming Li},
journal= {arXiv preprint arXiv:2411.13849},
year = {2025}
}
备注
Accepted by IEEE Transactions on Audio, Speech, and Language Processing