中文

面向连续西班牙语的说话人自适应端到端视觉语音识别

计算机视觉与模式识别 2023-11-22 v1 计算与语言 声音 音频与语音处理

摘要

不同的研究已表明视觉线索在语音感知过程中的重要性。事实上,音视频方法的发展推动了语音技术领域的进步。然而,尽管近期取得了令人瞩目的结果,视觉语音识别仍是一个开放的研究问题。在该任务中,由于舍弃了听觉,必须面对视觉歧义与建模静音的复杂性等挑战。不过,当从说话人相关的视角处理该问题时,其中部分挑战可得以缓解。因此,本文利用西班牙语 LIP-RTVE 数据库,研究为特定人估计专门的端到端系统会如何影响语音识别的质量。首先,提出了基于微调技术的不同自适应策略。随后,将一个预训练的 CTC/Attention 架构作为我们实验中的基线。我们的发现表明,当进行说话人自适应时,先使 VSR 系统适应任务域的两步微调过程带来了显著改进。此外,即便仅有有限数量的数据可用,也取得了与当前最优水平相当的结果。

关键词

引用

@article{arxiv.2311.12480,
  title  = {Speaker-Adapted End-to-End Visual Speech Recognition for Continuous Spanish},
  author = {David Gimeno-Gómez and Carlos-D. Martínez-Hinarejos},
  journal= {arXiv preprint arXiv:2311.12480},
  year   = {2023}
}

备注

Accepted in Proceedings of IberSpeech 2022 ( https://www.isca-speech.org/archive/iberspeech_2022/gimenogomez22_iberspeech.html )