中文

基于大语言模型的听助器零样图非侵入式语音可懂性研究

音频与语音处理 2025-09-04 v1 声音

摘要

本工作聚焦于使用大语言模型(LLM)进行听助器(HA)的零样图非侵入式语音可懂性评估。具体而言,我们介绍GPT-Whisper-HA,这是GPT-Whisper的一个扩展,后者是基于LLM的零样图非侵入式语音评估模型。GPT-Whisper-HA设计用于HA的语音评估,集成了MSBG听力损失和NAL-R模拟,以根据每个人的听力图处理音频输入,两个自动语音识别(ASR)模块用于音频到文本表示,以及GPT-4o预测两个相应的分数,随后对分数进行平均以获得最终估计分数。实验结果表明,GPT-Whisper-HA相较于GPT-Whisper实现了2.59%的相对均方根误差(RMSE)改进,确认了大语言模型在预测听助器用户主观可懂性方面的零样图语音评估潜力。

关键词

引用

@article{arxiv.2509.03021,
  title  = {A Study on Zero-Shot Non-Intrusive Speech Intelligibility for Hearing Aids Using Large Language Models},
  author = {Ryandhimas E. Zezario and Dyah A. M. G. Wisnu and Hsin-Min Wang and Yu Tsao},
  journal= {arXiv preprint arXiv:2509.03021},
  year   = {2025}
}

备注

Accepted to IEEE ICCE-TW 2025