LRW-Persian: 波斯语野外唇读数据集
计算机视觉与模式识别
2025-10-28 v1
摘要
唇读技术日益成为开发稳健语音识别系统和助听器患者技术的重要研究领域。然而,针对非英语的视觉语音识别资源仍相对有限。我们引入LRW-Persian,最大规模的波斯语单词级唇读数据集,包含743个目标单词,超过41.4万个视频样本,来自67个电视节目中的1900多小时录像。作为基准资源,LRW-Persian 提供说话人 disjoint 的训练和测试划分,覆盖广泛的地区和方言,并包含丰富的逐片元数据,包括头部姿态、年龄和性别。为确保大规模数据质量,我们建立了一套完全自动化的端到端数据清理流程,包括基于自动语音识别(ASR)的转录、主说话人定位、质量筛选和姿态/掩码检测。我们进一步在LRW-Persian上微调了两种广泛使用的唇读架构,建立了基准性能,展示了波斯语视觉语音识别的难度。通过填补低资源语言的关键缺口,LRW-Persian 实现了严格的基准测试,支持跨语言迁移,为在代表性不足的语言环境中推进多模态语音研究提供了基础。数据集公开可用于:https://lrw-persian.vercel.app。
引用
@article{arxiv.2510.22716,
title = {LRW-Persian: Lip-reading in the Wild Dataset for Persian Language},
author = {Zahra Taghizadeh and Mohammad Shahverdikondori and Arian Noori and Alireza Dadgarnia},
journal= {arXiv preprint arXiv:2510.22716},
year = {2025}
}
备注
12 pages, 6 figures