中文

面向说话人自适应视觉语音识别的深度神经网络提示微调

计算与语言 2024-10-21 v2 人工智能 计算机视觉与模式识别 声音 音频与语音处理 图像与视频处理

摘要

视觉语音识别(VSR)旨在仅依据唇部运动将语音推断为文本。由于它聚焦于建模语音的视觉信息,其性能天然对个人的唇部外观和动作敏感,这使得 VSR 模型在应用于未见说话人时表现出性能下降。在本文中,为弥补 VSR 模型在未见说话人上的性能退化,我们提出深度神经网络(DNNs)的提示微调方法用于说话人自适应 VSR。具体而言,受自然语言处理(NLP)近期进展的启发,我们在目标说话人的自适应数据上微调提示,而非修改预训练模型参数。与先前主要局限于 Transformer 变体架构的提示微调方法不同,我们探索了可一般应用于由 CNN 和 Transformer 组成的 VSR 模型的不同类型提示:加法、填充和拼接形式提示。通过所提提示微调,我们表明即便预训练模型已在较大说话人差异下开发,使用少量自适应数据(如少于 5 分钟)也能大幅提升预训练 VSR 模型在未见说话人上的性能。此外,通过分析不同类型提示的性能和参数,我们研究了何时提示微调优于微调方法。所提方法的有效性在词级和句级 VSR 数据库 LRW-ID 和 GRID 上进行了评估。

关键词

引用

@article{arxiv.2302.08102,
  title  = {Prompt Tuning of Deep Neural Networks for Speaker-adaptive Visual Speech Recognition},
  author = {Minsu Kim and Hyung-Il Kim and Yong Man Ro},
  journal= {arXiv preprint arXiv:2302.08102},
  year   = {2024}
}

备注

IEEE TPAMI