中文

面向中文普通话唇语识别的级联序列到序列模型

计算机视觉与模式识别 2019-12-02 v2 计算与语言

摘要

唇语识别旨在从说话者嘴部的运动中解码文本。近年来,英语的唇语识别方法在词级和句级上都取得了很大进展。然而,与英语不同,中文普通话是一种以声调为基础的语言,依靠音高来区分词汇或语法意义,这显著增加了唇语识别任务的歧义性。在本文中,我们提出了一种面向中文普通话的级联序列到序列模型(CSSMCM)用于唇语识别,该模型在预测句子时显式地对声调建模。声调基于视觉信息和句法结构进行建模,并与视觉信息和句法结构一起用于预测句子。为了评估 CSSMCM,我们收集并发布了一个名为 CMLR(中文普通话唇语识别)的数据集,包含来自中国网络电视台网站的超过 100,000 条自然句子。在 CMLR 数据集上训练时,所提出的 CSSMCM 超越了最先进的唇语识别框架的性能,这证实了显式建模声调对中文普通话唇语识别的有效性。

关键词

引用

@article{arxiv.1908.04917,
  title  = {A Cascade Sequence-to-Sequence Model for Chinese Mandarin Lip Reading},
  author = {Ya Zhao and Rui Xu and Mingli Song},
  journal= {arXiv preprint arXiv:1908.04917},
  year   = {2019}
}

备注

ACM MM Asia 2019