中文

面向聋人与听力障碍者的个性化语音识别系统开发分析

声音 2023-06-27 v1 音频与语音处理

摘要

聋人或听力障碍(DHH)说话者通常因耳聋而具有非典型语音。随着基于语音的设备和软件应用支持日益增多,需开展更多工作使这些设备对所有人具有包容性。为此,我们分析将公开可用的自动语音识别(ASR)工具用于 DHH 日语说话者数据集的情况。由于这些开箱即用的 ASR 模型通常在 DHH 语音上表现不佳,我们提供了创建个性化 ASR 系统的详尽分析。我们收集了由四位说话者组成、总计约 28.05 小时的较大 DHH 说话者数据集,并通过改变训练数据规模彻底分析了不同训练框架的性能。我们的结果表明,来自目标说话者的 1000 条语句(或 1-2 小时)已能以极少工作量显著改善模型性能,因此我们建议研究者收集至少 1000 条语句以构建高效的个性化 ASR 系统。在难以收集 1000 条语句的情况下,我们也发现当仅有 200 条语句时,使用先前提出的数据增强技术(如中间微调)可带来显著改进。

关键词

引用

@article{arxiv.2306.13953,
  title  = {An Analysis of Personalized Speech Recognition System Development for the Deaf and Hard-of-Hearing},
  author = {Lester Phillip Violeta and Tomoki Toda},
  journal= {arXiv preprint arXiv:2306.13953},
  year   = {2023}
}

备注

Submitted to APSIPA 2023