中文

LRS3-TED:用于视觉语音识别的大规模数据集

计算机视觉与模式识别 2018-10-30 v2

摘要

本文介绍了一个新的用于视觉和音视觉语音识别的多模态数据集。它包含来自超过 400 小时 TED 和 TEDx 视频的人脸轨迹,以及相应的字幕和词对齐边界。与其他可供通用研究的公开数据集相比,该新数据集规模显著更大。

关键词

引用

@article{arxiv.1809.00496,
  title  = {LRS3-TED: a large-scale dataset for visual speech recognition},
  author = {Triantafyllos Afouras and Joon Son Chung and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1809.00496},
  year   = {2018}
}

备注

The audio-visual dataset can be downloaded from http://www.robots.ox.ac.uk/~vgg/data/lip_reading/