中文

自动化说话人无关视觉语音识别:一项全面综述

计算机视觉与模式识别 2023-12-13 v1 人工智能

摘要

说话人无关视觉语音识别(VSR)是一项复杂任务,涉及从说话人面部运动的视频记录中识别 spoken 词语或短语。多年来,VSR 领域出现了大量研究,涉及不同算法与数据集以评估系统性能。这些努力促使有效 VSR 模型的发展取得显著进展,为该领域进一步研究创造了新机遇。本综述详细考察了过去三十年来 VSR 的演进,特别关注从说话人相关系统向说话人无关系统的转变。我们还全面概述了 VSR 研究中所用的各种数据集及为实现说话人无关所采用的预处理技术。综述涵盖 1990 至 2023 年发表的工作,透彻分析每项工作并基于多种参数进行比较。本综述深入分析了 1990 至 2023 年说话人无关 VSR 系统的演变,梳理了 VSR 系统随时间的演进,并强调开发端到端说话人无关 VSR 流水线的必要性。图示清晰简明地概览了说话人无关 VSR 中所用技术,从而有助于理解与分析各类方法。综述还强调了各项技术的优势与局限,并为开发分析视觉语音线索的新方法提供见解。总体而言,本全面综述深入剖析了当前最先进的说话人无关 VSR,并指出了未来研究的潜在方向。

关键词

引用

@article{arxiv.2306.08314,
  title  = {Automated Speaker Independent Visual Speech Recognition: A Comprehensive Survey},
  author = {Praneeth Nemani and G. Sai Krishna and Supriya Kundrapu},
  journal= {arXiv preprint arXiv:2306.08314},
  year   = {2023}
}