中文

SECP:一种基于语音增强的策展流水线,用于可扩展地获取纯净语音

声音 2024-02-21 v1 信息检索 机器学习 音频与语音处理

摘要

随着越来越多的语音技术依赖以纯净语音为真值的监督深度学习方法,迫切需要一种能够大规模引入此类语音的方法论。然而,该方法需最小化对人类听辨和标注的依赖,仅在必要时引入人机回环(human-in-the-loop)。本文通过概述基于语音增强的策展流水线(SECP)来解决这一问题,该流水线作为一个引入纯净语音的框架。这些纯净语音随后可用于训练语音增强模型,进而优化原始数据集,从而形成闭环迭代。经过两轮迭代实验,我们观察到,根据本文使用的指标 ΔPESQ\Delta_{PESQ},将增强后的输出作为真值并不会降低模型性能。此外,基于比较平均意见得分(CMOS)的主观测试表明,精炼数据的最高和最低边界在感知上均优于原始数据。

关键词

引用

@article{arxiv.2402.12482,
  title  = {SECP: A Speech Enhancement-Based Curation Pipeline For Scalable Acquisition Of Clean Speech},
  author = {Adam Sabra and Cyprian Wronka and Michelle Mao and Samer Hijazi},
  journal= {arXiv preprint arXiv:2402.12482},
  year   = {2024}
}

备注

Accepted to the International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2024