中文

RAL:基于对称视图差分学习的冗余感知唇语识别模型

计算机视觉与模式识别 2024-09-10 v1

摘要

唇语识别通过分析唇部运动序列来解读说话者的语音。目前,大多数模型将嘴唇的左右两半视为对称的整体,缺乏对其差异的深入研究。然而,嘴唇的左右两半并不总是对称的,它们之间的细微差异蕴含着丰富的语义信息。在本文中,我们提出了一种具有对称视图的差分学习策略(DLSV)来解决这一问题。此外,输入图像通常包含大量与识别结果无关的冗余信息,这会降低模型的性能。我们提出了一种冗余感知操作(RAO)来减少这些冗余信息。最后,为了利用对称视图之间以及各视图内部的关系信息,我们进一步设计了一个自适应跨视图交互模块(ACVI)。在 LRW 和 LRW-1000 数据集上的实验充分证明了我们方法的有效性。

关键词

引用

@article{arxiv.2409.05307,
  title  = {RAL:Redundancy-Aware Lipreading Model Based on Differential Learning with Symmetric Views},
  author = {Zejun gu and Junxia jiang},
  journal= {arXiv preprint arXiv:2409.05307},
  year   = {2024}
}

备注

5 pages, 4 figures