中文

LRW-1000:一种自然分布的大规模野外唇读基准数据集

计算机视觉与模式识别 2019-04-25 v6

摘要

大规模数据集已相继证明其在若干研究领域的基础重要性,尤其对于一些新兴课题的早期进展。本文关注视觉语音识别问题,亦称唇读,该问题近年来受到越来越多的兴趣。我们提出一个自然分布的大规模野外唇读基准数据集,名为 LRW-1000,其包含 1,000 个类别、来自 2,000 多名独立说话人的 718,018 个样本。每个类别对应于由一个或数个汉字组成的普通话词语的音节。据我们所知,它目前是最大的词级唇读数据集,也是唯一公开的大规模普通话唇读数据集。该数据集旨在覆盖不同语音模式与成像条件下的“自然”可变性,以纳入实际应用中遇到的挑战。该基准在多个方面表现出较大差异,包括每类样本数、视频分辨率、光照条件以及说话人姿态、年龄、性别和妆容等属性。除提供数据集及其采集流程的详细描述外,我们评估了几种典型流行的唇读方法,并从多个方面对结果进行了透彻分析。结果展示了我们数据集的一致性与挑战性,这可能为未来工作开辟一些有前景的新方向。

关键词

引用

@article{arxiv.1810.06990,
  title  = {LRW-1000: A Naturally-Distributed Large-Scale Benchmark for Lip Reading in the Wild},
  author = {Shuang Yang and Yuanhang Zhang and Dalu Feng and Mingmin Yang and Chenhao Wang and Jingyun Xiao and Keyu Long and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:1810.06990},
  year   = {2019}
}

备注

IEEE FG 2019