基于置信度的过滤:利用离散Token的生成式语音增强进行语音数据集管理
声音
2026-01-21 v1 音频与语音处理
摘要
生成式语音增强模型在从带噪输入中产生高质量干净语音方面展现出巨大潜力,使得诸如将带噪文本到语音数据集整理为高质量数据集等应用成为可能。然而,GSE模型容易出现幻觉错误,如音素遗漏和说话人不一致,而基于非侵入式语音质量指标的常规错误过滤通常无法检测到这些错误。为解决此问题,我们提出了一种非侵入式方法,用于从基于离散Token的GSE模型中过滤幻觉错误。我们的方法利用生成Token的对数概率作为置信度分数来检测潜在错误。实验结果表明,置信度分数与一系列侵入式语音增强指标强相关,并且我们的方法能有效识别常规过滤方法遗漏的幻觉错误。此外,我们展示了该方法的实际效用:使用我们基于置信度的过滤方法整理一个真实场景的TTS数据集,可提升后续训练的TTS模型的性能。
引用
@article{arxiv.2601.12254,
title = {Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens},
author = {Kazuki Yamauchi and Masato Murata and Shogo Seki},
journal= {arXiv preprint arXiv:2601.12254},
year = {2026}
}
备注
Accepted for ICASSP 2026