中文

conventional hybrid 与 CTC/Attention 解码器在连续视觉语音识别中的比较

计算机视觉与模式识别 2024-02-21 v1

摘要

随着深度学习的兴起以及大规模音视频数据库的可用性,视觉语音识别(VSR)近期取得了显著进展。类似于其他语音处理任务,这类基于编码器-解码器架构的端到端 VSR 系统通常依赖于编码器,而解码器则多种多样。虽然编码器较为通用,但已探索了多种解码方法,例如基于深度神经网络结合隐马尔可夫模型(DNN-HMM)的传统混合模型或连接时序分类(CTC)范式。然而,在数据稀缺的语言和任务中,针对不同解码器类型的比较尚不明确。因此,我们聚焦于传统 DNN-HMM 解码器及其数据稀缺情境下的先进 CTC/Attention 解码器之间的表现差异。我们还分析了视觉语音特征在非显式训练场景(如相似数据集或不同语言收集的数据集)下的适应能力。结果表明,在数据稀缺场景下,传统方法在识别率方面优于 CTC/Attention 模型,同时实现更短的训练时间和更少的参数。

关键词

引用

@article{arxiv.2402.13004,
  title  = {Comparison of Conventional Hybrid and CTC/Attention Decoders for Continuous Visual Speech Recognition},
  author = {David Gimeno-Gómez and Carlos-D. Martínez-Hinarejos},
  journal= {arXiv preprint arXiv:2402.13004},
  year   = {2024}
}

备注

Accepted at the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING)