中文

MA-LipNet:面向稳健口述识别的多维注意力网络

计算机视觉与模式识别 2026-01-30 v1

摘要

口述技术通过解码嘴部运动的静默视频中的语言内容,具有显著的应用价值,如公共安全领域。然而,由于关节动作微妙,现有口述方法常因特征判别性有限和泛化能力差而受限。为此,本文深入分析在时、空、通道三个维度上对视觉特征的纯化。我们提出一种新方法,名为多注意力口述网络(MA-LipNet)。MA-LipNet的核心在于依次应用三个专门的注意力模块:首先,采用通道注意力(Channel Attention, CA)模块,对通道级特征进行自适应校准,以减弱来自信息不足通道的干扰;随后,引入两种不同颗粒度的时空注意力模块——联合时空注意力(Joint Spatial-Temporal Attention, JSTA)与分离时空注意力(Separate Spatial-Temporal Attention, SSTA),以抑制无关像素和视频帧的影响。JSTA模块通过计算统一的时空权重图实现粗粒度过滤,而SSTA模块则分别建模时序与空间注意力,实现更细粒度的精炼。在CMLR和GRID数据集上进行的大量实验表明,MA-LipNet显著降低了字符错误率(CER)和词错误率(WER),验证了其有效性与优越性。我们的工作凸显了多维特征精炼对稳健视觉语音识别的重要性。

关键词

引用

@article{arxiv.2601.20881,
  title  = {MA-LipNet: Multi-Dimensional Attention Networks for Robust Lipreading},
  author = {Matteo Rossi},
  journal= {arXiv preprint arXiv:2601.20881},
  year   = {2026}
}