实现真实环境中以儿童为中心的音频录音的自动转录
声音
2025-06-16 v1 机器学习
摘要
佩戴在儿童身上的麦克风所获取的长期音频录音(也称为儿童中心的全天录音)已成为研究儿童语言体验及其对后续语言发展影响的标准方法。长期语音音频的转录能够在多个语言学层面实现丰富的分析,然而典型长期语料库的庞大规模阻碍了全面的手动标注。与此同时,基于自动语音识别(ASR)的转录面临重大挑战,原因在于真实世界音频的噪声性和不受约束的特性,且尚无现有研究成功将ASR应用于此类数据的转录。然而,此前的尝试均假设ASR必须处理每段长期录音的完整内容。在本工作中,我们提出了一种方法,用于自动检测长期音频中能够被现代ASR系统可靠转录的语句,从而实现对典型长期数据中所有语音的相当大比例的自动且相对准确的转录。我们在四个英语长期音频语料库上验证了该方法,结果表明,在转录数据集中13%的语音时,该方法达到了中位词错误率(WER)为0%、平均WER为18%的效果。相比之下,不经任何筛选直接转录所有语音则得到中位WER为52%、平均WER为51%。我们还将自动转录导出的词对数频率与手动标注的频率进行了比较,结果显示对于所有转录词,频率相关性为r=0.92(Pearson),对于在自动转录中出现至少五次的词,相关性为r=0.98。总体而言,本工作为对儿童中心长期音频进行日益精细的自动化语言学分析迈出了实质性的一步。
引用
@article{arxiv.2506.11747,
title = {Enabling automatic transcription of child-centered audio recordings from real-world environments},
author = {Daniil Kocharov and Okko Räsänen},
journal= {arXiv preprint arXiv:2506.11747},
year = {2025}
}
备注
pre-print