中文

基于语音合成的老年人情境数据增强用于老年人语音识别

计算与语言 2026-04-29 v1 声音

摘要

尽管近期在自动语音识别 (ASR) 方面取得了进展,但老年语音识别 (EASR) 仍然具有挑战性,这是由于训练数据有限以及老年人语音的独特声学和语言特征。本文通过结合大语言模型 (LLM) 驱动的 transcript 释义重写与文本转语音 (TTS) 合成,针对 EASR 数据稀缺问题提出了一种数据增强管道。给定老年人语音数据集,LLM 首先生成老年人情境的释义重写版本,然后 TTS 模型使用老年参考说话人合成相应语音。将生成的合成音频-文本对与原始数据合并,用于微调 Whisper,无需修改网络结构。我们进一步分析了数据增强比例和参考说话人组成在低资源 EASR 中的效果。在来自 70 岁以上说话人的英语和韩语老年人语音数据集上实验显示,所提方法在所有常规数据增强基线上均表现出优势,最高可实现对比 Whisper 基线的 58.2% 词错误率 (WER) 降低。

关键词

引用

@article{arxiv.2604.24770,
  title  = {Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR},
  author = {Minsik Lee and Seoi Hong and Chongmin Lee and Sieun Choi and Jian Kim and Jua Han and Jihie Kim},
  journal= {arXiv preprint arXiv:2604.24770},
  year   = {2026}
}

备注

5 pages, 2 figures, under review at IEEE Signal Processing Letters