SwinLip:一种使用 Swin Transformer 的高效唇读视觉语音编码器
计算机视觉与模式识别
2025-05-09 v1 声音
音频与语音处理
摘要
本文提出了一种用于唇读的高效视觉语音编码器。尽管最近大多数唇读研究基于 ResNet 架构并取得了显著成功,但由于在建模时空信息时计算复杂度高,它们并不足以高效捕获唇读特征。此外,使用复杂的视觉模型不仅增加了唇读模型的复杂性,还会导致多模态研究(例如,视听语音识别、语音增强和语音分离)中整体网络的延迟。为克服基于卷积神经网络(CNN)模型的局限性,我们将 Swin Transformer 的分层结构和窗口自注意力应用于唇读。我们配置了适合处理唇读数据的新型轻量级 Swin Transformer 规模,并提出了 SwinLip 视觉语音编码器,该编码器通过在分层结构中集成改进的卷积增强 Transformer(Conformer)时间嵌入与传统空间嵌入,有效降低了计算负荷。通过大量实验,我们验证了当应用于词和句子识别的各种骨干网络时,我们的 SwinLip 成功提高了唇读网络的性能和推理速度,并降低了计算负荷。特别是,我们的 SwinLip 在英文 LRW 和普通话 LRW-1000 数据集上均表现出稳健性能,并且与现有 state-of-the-art 模型相比,以更少的计算量在普通话 LRW-1000 数据集上取得了 state-of-the-art 性能。
引用
@article{arxiv.2505.04394,
title = {SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer},
author = {Young-Hu Park and Rae-Hong Park and Hyung-Min Park},
journal= {arXiv preprint arXiv:2505.04394},
year = {2025}
}