中文

利用原始超声成像自动分类儿童语音中的音段

声音 2025-12-10 v1 人工智能 计算机视觉与模式识别 音频与语音处理

摘要

语音声音障碍 (SSD) 定义为语音产生方面的持续性损伤,导致语音可懂度降低并阻碍口头交流。早期识别和干预患有 SSD 的儿童,并及时转介给言语语言治疗师 (SLTs) 进行治疗至关重要。自动检测语音障碍被视为检查和筛查大量人群的有效方法。本研究旨在通过提出一种整合超声舌成像 (UTI) 与深度学习模型的技术解决方案,推进幼儿期 SSD 的自动诊断。所提出的 FusionNet 模型结合了 UTI 数据与提取的纹理特征来对 UTI 进行分类。其总体目标是提高 UTI 分析的准确性和效率,特别是针对与 SSD 相关的语音声音分类。本研究将 FusionNet 方法与标准深度学习方法进行了比较,突出了 FusionNet 模型在 UTI 分类方面的显著改进结果,以及多学习在改善言语治疗诊所中 UTI 分类的潜力。

关键词

引用

@article{arxiv.2402.17482,
  title  = {Automated Classification of Phonetic Segments in Child Speech Using Raw Ultrasound Imaging},
  author = {Saja Al Ani and Joanne Cleland and Ahmed Zoha},
  journal= {arXiv preprint arXiv:2402.17482},
  year   = {2025}
}