中文

利用困惑度分析解耦唇读中的同视素词

计算与语言 2020-12-15 v1

摘要

使用视素作为分类模式的自动唇读性能,相较于使用 ASCII 字符与单词,取得的成功较小,这主要归因于不同单词共享相同视素的问题。生成式预训练变换器是一种有效的自回归语言模型,用于自然语言处理中的许多任务,包括句子预测与文本分类。本文提出该模型的一种新应用,并将其应用于唇读语境中,作为语言模型将视素形式的视觉语音转换为单词与句子形式的语言。该网络利用对最优困惑度的搜索来执行视素到单词的映射,从而解决了存在的多词发音不同而外观相同的一对多映射问题。本文提出一种方法,在仅使用视觉线索进行自动唇读时应对两种独立场景下的多对一映射问题:第一种场景是词边界(即词的起止)未知;第二种场景是边界已知。来自基准 BBC 数据集“Lip Reading Sentences in the Wild”(LRS2)的句子被分类,字符错误率为 10.7%,词错误率为 18.0%。本文的主要贡献是提出一种在仅存在视觉线索时利用自回归语言模型通过困惑度分析预测单词的方法。

关键词

引用

@article{arxiv.2012.07528,
  title  = {Disentangling Homophemes in Lip Reading using Perplexity Analysis},
  author = {Souheil Fenghour and Daqing Chen and Kun Guo and Perry Xiao},
  journal= {arXiv preprint arXiv:2012.07528},
  year   = {2020}
}

备注

17 pages