中文

从弱标签到强结果:利用5000小时噪声教室转录稿及最小准确数据

音频与语音处理 2026-02-24 v1 计算与语言 声音

摘要

最近的语音识别进展依赖于在大量标记数据上训练的模型。然而,教室自动语音识别(ASR)面临着真实世界的挑战:大量弱转录稿搭配着仅少量准确的金标准数据。在此低资源环境下,高昂的转录成本使得重新转录难以实现。为此,我们提出的问题是:当 abundant 廉价弱转录稿与 limited 金标准数据并存时,应采取何种最佳方法,正如教室语音数据所呈现的情形。我们提出了弱监督预训练(Weakly Supervised Pretraining, WSP),这是一种两步方法:首先在弱转录稿上以监督方式进行预训练,然后在准确数据上进行微调。我们的结果基于人工合成的弱转录稿和真实弱转录稿,显示WSP优于其他方法,确立了其作为低资源ASR训练方法的有效性。

关键词

引用

@article{arxiv.2505.17088,
  title  = {From Weak Labels to Strong Results: Utilizing 5,000 Hours of Noisy Classroom Transcripts with Minimal Accurate Data},
  author = {Ahmed Adel Attia and Dorottya Demszky and Jing Liu and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:2505.17088},
  year   = {2026}
}