Whilter:一种基于Whisper的“野外”语音语料库数据过滤器,利用话语级多任务分类
声音
2025-08-26 v2 机器学习
音频与语音处理
摘要
近年来,大规模野外语音数据集变得越来越普遍,这是因为人们对能够从未标记数据中学习有用特征以用于语音识别或合成等任务的模型兴趣增加。这些数据集通常包含不良特征,例如多说话人、非目标语言和音乐,这些特征可能会影响模型学习。Whilter模型被提出作为一种多任务解决方案,用于识别这些不良样本。Whilter使用Whisper编码器和基于注意力的分类器,一次性解决五个不同的分类问题。此外,我们还为两个流行的野外语料库的子集发布了一个带注释的数据集。Whilter在五个子任务中的三个上取得了超过85%的F1分数和6.5%至7.8%的等错误率,在语音特定类别上优于最先进的BEATs分类器,并且与单任务替代方案的组合相比,处理时间显著减少。
引用
@article{arxiv.2507.21642,
title = {Whilter: A Whisper-based Data Filter for "In-the-Wild" Speech Corpora Using Utterance-level Multi-Task Classification},
author = {William Ravenscroft and George Close and Kit Bower-Morris and Jamie Stacey and Dmitry Sityaev and Kris Y. Hong},
journal= {arXiv preprint arXiv:2507.21642},
year = {2025}
}
备注
Accepted for Interspeech 2025. Updated Zenodo link for AITW v1.1