个性化唇读:针对独特唇部动作的视觉与语言适应
计算机视觉与模式识别
2025-01-03 v2 计算与语言
音频与语音处理
图像与视频处理
摘要
唇读旨在通过分析唇部动作来预测 spoken language。尽管唇读技术取得了进展,但当模型应用于未见的说话者时性能会下降,因为其对视觉信息(如唇部外观)变化敏感。为解决这一挑战,针对视觉模态的说话者自适应唇读技术已取得进展,侧重于有效地将唇读模型适应目标说话者。然而,针对目标说话者语言信息(如词汇选择)的适应尚未在先前工作中得到探讨。此外,现有数据集用于说话者适应的词汇大小有限且面部姿态变形,这限制了在野外场景下验证先前说话者自适应方法的有效性。为解决这些问题,我们提出一种 novel 说话者自适应唇读方法,该方法在视觉和语言水平上适应预训练模型以适应目标说话者。具体而言,我们整合了 prompt tuning 和 LoRA 方法,将其应用于预训练的唇读模型,以有效地将模型适应目标说话者。此外,为验证其在野外场景的有效性,我们引入了一个新数据集 VoxLRS-SA,源自 VoxCeleb2 和 LRS3。该数据集包含约 10 万词汇,提供多样化的姿态变形,首次在英语中实现野外场景、句子级唇读的验证。通过各种实验,我们证明了现有说话者自适应方法在野外场景下也能在句子级提升性能。此外,我们展示了所提方法相较于前述工作实现了更大的性能提升。
关键词
引用
@article{arxiv.2409.00986,
title = {Personalized Lip Reading: Adapting to Your Unique Lip Movements with Vision and Language},
author = {Jeong Hun Yeo and Chae Won Kim and Hyunjun Kim and Hyeongseop Rha and Seunghee Han and Wen-Huang Cheng and Yong Man Ro},
journal= {arXiv preprint arXiv:2409.00986},
year = {2025}
}
备注
Code available: https://github.com/JeongHun0716/Personalized-Lip-Reading