面向多模态波斯语语音识别的多用途视听语料库:Arman-AV 数据集
计算与语言
2023-01-25 v1 声音
音频与语音处理
摘要
近年来,自动唇读取得了显著进展。但这些方法需要大规模数据集,而许多低资源语言并不具备此类数据。本文提出了一个面向波斯语的新型多用途视听数据集。该数据集包含近 220 小时视频,对应 1760 名说话人。除唇读外,该数据集还适用于自动语音识别、视听语音识别与说话人识别。它也是首个波斯语大规模唇读数据集。我们为上述每项任务提供了基线方法。此外,我们提出了一种检测波斯语视素(音素的视觉等价物)的技术。相较先前提出的视素,该方法获得的视素使唇读任务的准确率相对提升 7%,且可应用于其他语言。
引用
@article{arxiv.2301.10180,
title = {A Multi-Purpose Audio-Visual Corpus for Multi-Modal Persian Speech Recognition: the Arman-AV Dataset},
author = {Javad Peymanfard and Samin Heydarian and Ali Lashini and Hossein Zeinali and Mohammad Reza Mohammadi and Nasser Mozayani},
journal= {arXiv preprint arXiv:2301.10180},
year = {2023}
}