LRWR:俄语唇读大规模基准
计算机视觉与模式识别
2021-09-15 v1 机器学习
摘要
唇读,也称为视觉语音识别,旨在通过分析嘴唇及附近区域的视觉形变从视频中识别语音内容。该领域研究的一个重大障碍是缺乏面向多种语言的合适数据集:迄今为止,这些方法仅聚焦于英语或汉语。本文介绍了一个自然分布的大规模俄语唇读基准,名为 LRWR,包含 235 个类别和 135 位说话人。我们提供了数据集收集流程与数据集统计的详细描述。我们还给出了当前流行唇读方法在 LRWR 上的综合对比,并对其性能进行了详细分析。结果展示了被基准测试语言之间的差异,并为唇读模型微调提供了若干有前景的方向。得益于我们的发现,我们还在 LRW 基准上取得了新的最先进结果。
引用
@article{arxiv.2109.06692,
title = {LRWR: Large-Scale Benchmark for Lip Reading in Russian language},
author = {Evgeniy Egorov and Vasily Kostyumov and Mikhail Konyk and Sergey Kolesnikov},
journal= {arXiv preprint arXiv:2109.06692},
year = {2021}
}