LRS3-TED:用于视觉语音识别的大规模数据集
计算机视觉与模式识别
2018-10-30 v2
摘要
本文介绍了一个新的用于视觉和音视觉语音识别的多模态数据集。它包含来自超过 400 小时 TED 和 TEDx 视频的人脸轨迹,以及相应的字幕和词对齐边界。与其他可供通用研究的公开数据集相比,该新数据集规模显著更大。
引用
@article{arxiv.1809.00496,
title = {LRS3-TED: a large-scale dataset for visual speech recognition},
author = {Triantafyllos Afouras and Joon Son Chung and Andrew Zisserman},
journal= {arXiv preprint arXiv:1809.00496},
year = {2018}
}
备注
The audio-visual dataset can be downloaded from http://www.robots.ox.ac.uk/~vgg/data/lip_reading/