中文

基于预训练视觉特征提取器与约束 CTC 解码的多流神经网络架构用于提示语识别

计算与语言 2022-04-12 v1 声音 音频与语音处理

摘要

本文提出一种简单而有效的提示语(Cued Speech, CS)自动识别方法,CS 是一种视觉交流工具,借助能唯一识别所发音素以补充唇读的手势,帮助听力障碍人士理解口语。所提方法基于用于视觉特征提取的预训练手与唇跟踪器,以及基于多流循环神经网络并在连接主义时序分类损失下训练且结合发音词典的音素解码器。所提系统在更新版的法语 CS 数据集 CSF18 上评估,该数据集的音素转写已人工核对并修正。在音素级达到 70.88% 的解码准确率下,所提系统优于我们此前的 CNN-HMM 解码器,并与更复杂的基线方法相竞争。

关键词

引用

@article{arxiv.2204.04965,
  title  = {Multistream neural architectures for cued-speech recognition using a pre-trained visual feature extractor and constrained CTC decoding},
  author = {Sanjana Sankar and Denis Beautemps and Thomas Hueber},
  journal= {arXiv preprint arXiv:2204.04965},
  year   = {2022}
}