面向中文 stuttering 事件检测的细粒度对比学习
声音
2024-10-10 v1 音频与语音处理
摘要
本文介绍了 T031 团队在 SLT2024 StutteringSpeech 挑战赛中所采用的方案。中文 Stuttering 事件检测(Mandarin Stuttering Event Detection, MSED)旨在检测中文语音中的 stuttering 事件实例。我们提出了一种详细的声学分析方法,以提高 stutter 检测准确率,捕捉以往 Stuttering 事件检测(Stuttering Event Detection, SED)技术所忽视的细微差别。为此,我们引入了面向 MSED 的细粒度对比学习(Fine-Grained Contrastive Learning, FGCL)框架。具体而言,我们对 stuttering 事件的帧级概率进行建模,并引入一种矢antation 算法来识别易识别帧和易混淆帧。随后,我们提出了一种 stutter 对比损失,以增强 stutter 语音帧和流畅语音帧之间的区分度,从而提高 stutter 特征嵌入的判别能力。在英语和中文数据集上的广泛评估表明,FGCL 的有效性,在中文数据上 F1 分数提升了超过 5.0%。
引用
@article{arxiv.2410.05647,
title = {FGCL: Fine-grained Contrastive Learning For Mandarin Stuttering Event Detection},
author = {Han Jiang and Wenyu Wang and Yiquan Zhou and Hongwu Ding and Jiacheng Xu and Jihua Zhu},
journal= {arXiv preprint arXiv:2410.05647},
year = {2024}
}
备注
Accepted to SLT 2024