中文

利用语音调谐嵌入增强儿童发声分类以辅助自闭症诊断

音频与语音处理 2024-06-07 v2 声音

摘要

对自闭症风险儿童的评估通常需要临床医生观察、记录并评定儿童行为。一个能够标注成人与儿童音频的机器学习模型可大幅节省儿童行为编码的人力,帮助临床医生捕捉关键事件并更好地与父母沟通。在本研究中,我们利用在 4300 小时 5 岁以下儿童家庭音频上预训练的 Wav2Vec 2.0(W2V2),构建一个统一系统,用于临床医生-儿童说话人日记化与发声分类(VC)任务。为增强儿童的 VC,我们构建了针对 4 岁以下儿童的 W2V2 音素识别系统,并将其语音调谐嵌入作为辅助特征纳入,或将识别伪音素转录作为辅助任务。我们在两个语料库(Rapid-ABC 与 BabbleCor)上测试了方法并取得一致改进。此外,我们在 BabbleCor 的可复现子集上超越了最先进性能。代码见 https://huggingface.co/lijialudew

关键词

引用

@article{arxiv.2309.07287,
  title  = {Enhancing Child Vocalization Classification with Phonetically-Tuned Embeddings for Assisting Autism Diagnosis},
  author = {Jialu Li and Mark Hasegawa-Johnson and Karrie Karahalios},
  journal= {arXiv preprint arXiv:2309.07287},
  year   = {2024}
}

备注

Accepted to Interspeech 2024