以深度伪造音频作为数据增强技术训练自动语音转文本转录模型
声音
2026-05-01 v1 机器学习
音频与语音处理
摘要
要训练产生鲁棒结果的转录模型,需要大规模且多样化的标注数据集。寻找具备必要特征的此类数据是一项具有挑战性的任务,尤其是对于流行度低于英语的语言。此外,制作此类数据需要大量精力和往往不菲的经费。因此,缓解该问题的一种策略是使用数据增强技术。在本工作中,我们提出一个基于深度伪造音频处理数据增强的框架。为验证所构建的框架,使用现有的深度伪造与转录模型进行了实验。选取了一个语音克隆器以及由印度人(以英语)制作的数据集,确保数据集中存在单一口音。随后,增强数据被用于在各种场景下训练语音转文本模型。
引用
@article{arxiv.2309.12802,
title = {Deepfake audio as a data augmentation technique for training automatic speech to text transcription models},
author = {Alexandre R. Ferreira and Cláudio E. C. Campelo},
journal= {arXiv preprint arXiv:2309.12802},
year = {2026}
}
备注
9 pages, 6 figures, 7 tables