中文

虚拟声学环境中的神经语音跟踪:无脚本连续语音的视听协同效应

音频与语音处理 2025-01-15 v1 声音

摘要

音视协同效应,即在语音感知中,符合条件的视觉输入如何增强听觉处理,已在不同年龄段个体中得到充分记录,尤其是在具挑战性的聆听环境中以及不同听力功能者群体中。然而,大多数研究依赖于高度受控的实验室环境中使用剧本化刺激。本文我们在虚拟声学环境中使用无脚本、来自未经过训练的说话者的自然语音,探讨音视协同效应。我们运用电生理信号 (EEG) 和皮层语音跟踪技术,对不同条件下的神经响应进行评估,包括音视条件、仅音频条件、仅视觉条件以及遮蔽唇条件,以隔离唇部运动的作用。此外,我们分析说话者在声学和视觉特征(包括基频、抖动和唇部张开程度)上的个体差异,以探讨其对音视语音跟踪协同效应的影响。结果显示,在有背景噪声的情况下,音视条件显著提升语音跟踪表现,而遮蔽唇条件的表现与仅音频条件相似,凸显了在恶劣聆听环境中唇部运动的重要性。我们的发现表明,尽管使用自然化刺激,皮层语音跟踪仍是可行的,并强调了说话者个体特征对现实世界聆听情境中音视整合的影响。

关键词

引用

@article{arxiv.2501.08124,
  title  = {Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech},
  author = {Mareike Daeglau and Juergen Otten and Giso Grimm and Bojana Mirkovic and Volker Hohmann and Stefan Debener},
  journal= {arXiv preprint arXiv:2501.08124},
  year   = {2025}
}