数据集划分对不流畅检测系统的影响
音频与语音处理
2022-10-31 v1 计算与语言
声音
摘要
本文实证研究了不同数据切分与划分策略对不流畅检测系统性能的影响。为此,我们使用带有分类头的 wav2vec 2.0 模型以及结合从 wav2vec 2.0 模型提取特征的支持向量机(SVM)进行实验以检测不流畅。我们利用 Stuttering Events in Podcasts(SEP-28k)数据集的不同非说话人排他性和说话人排他性划分来训练和评估系统,以阐明结果相对于所用划分方法的可变性。此外,我们表明 SEP-28k 数据集由极少数说话人主导,难以评估。为补救此问题,我们创建了 SEP-28k-Extended(SEP-28k-E),包含为 SEP-28k 语料库半自动生成的说话人与性别信息,并提出了不同的数据划分,各自可用于评估不流畅检测方法的其他方面。
引用
@article{arxiv.2206.03400,
title = {The Influence of Dataset Partitioning on Dysfluency Detection Systems},
author = {Sebastian P. Bayerl and Dominik Wagner and Elmar Nöth and Tobias Bocklet and Korbinian Riedhammer},
journal= {arXiv preprint arXiv:2206.03400},
year = {2022}
}
备注
Accepted at the 25th International Conference on Text, Speech and Dialogue (TSD 2022)