中文

词级波斯语唇读数据集

计算机视觉与模式识别 2023-04-11 v1

摘要

近年来,在深度学习的推动下,唇读取得了令人印象深刻的进展。然而,此类进展的前提是合适的数据集。本文提供了一个新的真实场景词级波斯语唇读数据集,包含来自约 1,800 名说话人的 244,000 个视频。我们评估了该领域最先进的方法,并使用了一种用于词级唇读的新方法。在该方法中,我们使用 AV-HuBERT 模型进行特征提取,并在我们的数据集上获得了显著更好的性能。

关键词

引用

@article{arxiv.2304.04068,
  title  = {Word-level Persian Lipreading Dataset},
  author = {Javad Peymanfard and Ali Lashini and Samin Heydarian and Hossein Zeinali and Nasser Mozayani},
  journal= {arXiv preprint arXiv:2304.04068},
  year   = {2023}
}