中文

TD3Net:用于语音识别的时间密集连接多稀释卷积网络

计算机视觉与模式识别 2026-01-06 v4

摘要

词级语音识别方法通常采用包含前端和后端架构的双阶段框架来建模动态 lip movements。每个组件都得到了广泛研究,后端架构中广泛采用了时间卷积网络(TCN)。最近,密集 skip 连接被引入 TCN 以缓解受限的感受野密度,从而提高对复杂时序表征的建模。然而,由于受限感受野中存在 blind spots 导致对 lip movements 持续性信息丢失,性能仍受到限制。为此,我们提出 TD3Net,一种时间密集连接多稀释卷积网络,将密集 skip 连接和多稀释时序卷积作为后端架构。通过对 skip 连接特征应用不同的膨胀因子,TD3Net 在无 blind spots 的情况下覆盖广而密集的感受野。在使用两个大型公开数据集(Lip Reading in the Wild (LRW) 和 LRW-1000)进行词级语音识别任务的实验结果表明,所提方法的性能与最先进的方法相当。它在参数更少且浮点运算更低的情况下实现了更高的准确率,优于现有基于 TCN 的后端架构。此外,可视化结果表明,我们的方法在保持时序连续性的同时有效利用了多样化的时序特征,在语音识别系统中展现出显著优势。代码已在我们的 GitHub 仓库(https://github.com/Leebh-kor/TD3Net)中提供。

关键词

引用

@article{arxiv.2506.16073,
  title  = {TD3Net: A temporal densely connected multi-dilated convolutional network for lipreading},
  author = {Byung Hoon Lee and Wooseok Shin and Sung Won Han},
  journal= {arXiv preprint arXiv:2506.16073},
  year   = {2026}
}

备注

Accepted for publication in Journal of Visual Communication and Image Representation. DOI: https://doi.org/10.1016/j.jvcir.2025.104540