基于连续积分触发利用说话人差异与语音内容的词元级说话人变换检测
声音
2022-11-18 v1 音频与语音处理
摘要
在会议和对话等多说话人场景中,语音处理系统通常需要先对音频进行分割,然后对每个分割段进行转写。这两个阶段分别由说话人变换检测(SCD)和自动语音识别(ASR)独立处理。以往大多数SCD系统仅依赖说话人信息,忽视了语音内容的重要性。本文提出一种新颖的SCD系统,同时考虑说话人差异和语音内容两种线索。这两种线索通过连续积分触发(CIF)机制转换为词元级表示,随后在词元声学边界上结合以检测说话人变换。我们在公开真实录音会议数据集AISHELL-4上评估了本方法的性能。实验结果表明,我们的方法比一个有竞争力的帧级基线系统在等覆盖纯度(ECP)上高出2.45%。此外,我们证明了语音内容和说话人差异对SCD任务的重要性,以及相比逐帧进行SCD,在词元声学边界上进行SCD的优势。
引用
@article{arxiv.2211.09381,
title = {Token-level Speaker Change Detection Using Speaker Difference and Speech Content via Continuous Integrate-and-fire},
author = {Zhiyun Fan and Zhenlin Liang and Linhao Dong and Yi Liu and Shiyu Zhou and Meng Cai and Jun Zhang and Zejun Ma and Bo Xu},
journal= {arXiv preprint arXiv:2211.09381},
year = {2022}
}