中文

音视频整合在自监督语音模型中语音编码的时间历程中的作用

音频与语音处理 2025-06-26 v1 声音 图像与视频处理

摘要

人类语音感知是多模态的。在自然语音中,嘴部动作可以比对应的声音早出100-300毫秒,尤其是针对特定辅音,这种情况影响人类听者中神经语音编码的时间历程。然而,探讨自监督学习模型——这些模型被用于模拟人类的音视频整合——是否能够捕捉音频和视觉线索之间的这种异步性,仍未探讨。我们将AV-HuBERT(一种音视频模型)与音频唯一HuBERT进行比较,通过使用线性分类器跟踪其在时间上的语音可解性。我们发现,在AV-HuBERT嵌入中,语音信息只有约20毫秒在HuBERT之前可用,可能是由于AV-HuBERT的较低时间分辨率和特征拼接过程。这表明AV-HuBERT未能充分捕捉多模态语音感知的时间动力学,限制了其模拟多模态语音感知过程的适用性。

关键词

引用

@article{arxiv.2506.20361,
  title  = {The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models},
  author = {Yi Wang and Oli Danyi Liu and Peter Bell},
  journal= {arXiv preprint arXiv:2506.20361},
  year   = {2025}
}

备注

Accepted by Interspeech 2025