中文

进行性构音障碍导致言语退化对 ASR 性能的影响分析

音频与语音处理 2022-11-02 v1 计算与语言 声音

摘要

尽管个性化自动语音识别(ASR)模型近来已被设计用于识别甚至严重受损的语音,但对于言语退化的使用者,模型性能可能随时间下降。本研究的目的是:(1)分析 ASR 在言语退化个体中随时间变化的性能;(2)探索在疾病进展过程中优化识别的缓解策略。语音由四名因肌萎缩侧索硬化(ALS)导致言语退化的个体录制。针对三种 ASR 模型计算了各录音会话的单词错误率(WER):未适配说话人无关模型(U-SI)、适配说话人无关模型(A-SI)和适配说话人相关模型(A-SD 或个性化)。随着言语受损加重,三种模型的性能均随时间显著下降,但当使用言语进展严重阶段的录音进行更新时,A-SD 模型性能明显提升。在言语显著退化前疾病早期录制额外语句并未改善 A-SD 模型性能。总体而言,我们的发现强调了在为进行性言语障碍个体提供个性化模型时,持续录音(及模型重训练)的重要性。

关键词

引用

@article{arxiv.2211.00089,
  title  = {An analysis of degenerating speech due to progressive dysarthria on ASR performance},
  author = {Katrin Tomanek and Katie Seaver and Pan-Pan Jiang and Richard Cave and Lauren Harrel and Jordan R. Green},
  journal= {arXiv preprint arXiv:2211.00089},
  year   = {2022}
}

备注

Submitted to ICASSP 2023