中文

用于序列到序列唇读的伪卷积策略梯度

计算机视觉与模式识别 2020-03-26 v1 机器学习 图像与视频处理

摘要

唇读旨在从唇动序列推断语音内容,可视为一个典型的序列到序列(seq2seq)问题,即将唇动输入图像序列翻译为语音内容的文本序列。然而,seq2seq 模型的传统学习过程总是受两个问题困扰:由“教师强制”策略导致的暴露偏差,以及判别优化目标(通常为交叉熵损失)与最终评估指标(通常为字符/词错误率)之间的不一致。在本文中,我们提出一种基于新颖的伪卷积策略梯度(PCPG)的方法来应对这两个问题。一方面,我们引入评估指标(本文中指字符错误率)作为奖励形式,与原始判别目标共同优化模型。另一方面,受卷积运算局部感知特性的启发,我们在奖励和损失维度上执行伪卷积操作,从而考虑每个时间步周围更多上下文,为整体优化生成鲁棒的奖励和损失。最后,我们在词级和句级基准上进行了详尽对比与评估。结果表明相较其他相关方法有显著提升,并在所有这些具挑战性基准上报告了新的最先进性能或具竞争力的准确率,清晰证明了我们方法的优势。

关键词

引用

@article{arxiv.2003.03983,
  title  = {Pseudo-Convolutional Policy Gradient for Sequence-to-Sequence Lip-Reading},
  author = {Mingshuang Luo and Shuang Yang and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2003.03983},
  year   = {2020}
}

备注

8 pages, Accepted in the 15th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2020)