中文

利用自监督音视觉预训练模型改善人工耳蜗模拟中声码语音可懂度

音频与语音处理 2025-10-07 v3

摘要

听力受损人士在理解语音方面面临挑战,尤其在噪声环境中。本研究旨在探索音视觉语音增强(AVSE)在人工耳蜗(CI)模拟中提升声码语音可懂度的有效性。值得注意的是,研究聚焦于AVSE任务训练数据有限的困难场景。为解决此问题,我们提出一种称为基于自监督学习的AVSE(SSL-AVSE)的新型深度神经网络框架。所提出的SSL-AVSE将目标说话人的视觉线索(如唇部与口部运动)与相应音频信号相结合。上下文融合的音视频数据随后被输入基于Transformer的SSL AV-HuBERT模型以提取特征,并进一步由基于BLSTM的SE模型处理。结果展示了若干关键发现。首先,SSL-AVSE通过利用AV-HuBERT模型成功克服了数据有限的问题。其次,通过为目标的SE任务微调AV-HuBERT模型参数,实现了显著的性能提升。具体而言,PESQ(感知语音质量评价)从1.43提升至1.67,STOI(短时客观可懂度)从0.70提升至0.74。此外,使用CI声码语音评估了SSL-AVSE的性能以衡量CI用户的可懂度。对比实验结果显示,在人际对话遇到的动态噪声下,SSL-AVSE表现出实质性改善。NCM(正态相关矩阵)值表明相较噪声基线提升了26.5%至87.2%。

关键词

引用

@article{arxiv.2307.07748,
  title  = {Leveraging Self-Supervised Audio-Visual Pretrained Models to Improve Vocoded Speech Intelligibility in Cochlear Implant Simulation},
  author = {Richard Lee Lai and Jen-Cheng Hou and I-Chun Chern and Kuo-Hsuan Hung and Yi-Ting Chen and Mandar Gogate and Tughrul Arslan and Amir Hussain and Yu Tsao},
  journal= {arXiv preprint arXiv:2307.07748},
  year   = {2025}
}