从众包半结构化语音记录分类自闭症:一种机器学习方法
声音
2022-01-05 v1 机器学习
音频与语音处理
摘要
自闭症谱系障碍(ASD)是一种神经发育障碍,会导致行为、社会发育与沟通模式改变。过去数年,自闭症患病率增至三倍,如今每 54 名儿童中即有 1 名受影响。鉴于传统诊断是一个漫长、劳动密集型的过程,人们已高度重视开发自动筛查自闭症的系统。韵律异常是自闭症最明确的迹象之一,患病儿童表现出包括仿说、单调语调、非典型音高与不规则语言重音模式在内的言语特异性。本工作中,我们提出一套机器学习方法,用于检测在居家环境中由自闭症与神经典型(NT)儿童自录的语音音频中的自闭症。我们考虑三种检测儿童言语中自闭症的方法:第一,在提取的音频特征(包括梅尔频率倒谱系数)上训练的随机森林;第二,在频谱图上训练的卷积神经网络(CNNs);第三,微调的 wav2vec 2.0——一种最先进的基于 Transformer 的 ASR 模型。我们在从斯坦福 Guess What? 手机游戏整理的新型数据集上训练分类器,该应用旨在众包自然居家环境下自闭症与神经典型儿童的视频。随机森林分类器达到 70% 准确率,微调的 wav2vec 2.0 模型达到 77% 准确率,而 CNN 在将儿童音频分类为 ASD 或 NT 时达到 79% 准确率。我们的模型在由录制质量不一致的多样居家音频片段上训练时能够预测自闭症状态,这可能更可推广至真实世界条件。这些结果表明,机器学习方法有望在无需专用设备的情况下从语音中自动检测自闭症。
引用
@article{arxiv.2201.00927,
title = {Classifying Autism from Crowdsourced Semi-Structured Speech Recordings: A Machine Learning Approach},
author = {Nathan A. Chi and Peter Washington and Aaron Kline and Arman Husic and Cathy Hou and Chloe He and Kaitlyn Dunlap and Dennis Wall},
journal= {arXiv preprint arXiv:2201.00927},
year = {2022}
}
备注
17 pages, 4 figures, submitted to JMIR Pediatrics and Parenting