SimClass:面向自动语音识别研究的基于游戏引擎仿真的课堂语音数据集
声音
2025-06-12 v1 人工智能
计算与语言
音频与语音处理
摘要
大规模课堂语音数据的匮乏阻碍了面向教育的AI语音模型的发展。公开的课堂数据集仍然有限,且缺乏专用的课堂噪声语料库,使得标准数据增强技术无法使用。在本文中,我们提出了一种利用游戏引擎合成课堂噪声的可扩展方法,该框架可扩展至其他领域。利用该方法,我们发布了SimClass,一个包含合成课堂噪声语料库和模拟课堂语音数据集的数据集。语音数据通过将公开的儿童语音语料库与YouTube讲座视频配对来生成,以近似真实课堂环境中的干净交互条件。我们在干净和含噪语音上的实验表明,SimClass与真实课堂语音高度近似,使其成为开发鲁棒的语音识别和增强模型的宝贵资源。
引用
@article{arxiv.2506.09206,
title = {SimClass: A Classroom Speech Dataset Generated via Game Engine Simulation For Automatic Speech Recognition Research},
author = {Ahmed Adel Attia and Jing Liu and Carl Espy-Wilson},
journal= {arXiv preprint arXiv:2506.09206},
year = {2025}
}