乌尔都语自然场景文本检测、识别与视觉问答的数据集与基准
计算机视觉与模式识别
2024-05-22 v1
摘要
乌尔都语场景文本检测、识别和视觉问答(VQA)技术的发展对于提升数字内容的可访问性、信息检索和语言多样性至关重要,有助于更好地理解和交互乌尔都语视觉数据。这一举措旨在弥合文本与视觉理解之间的差距。我们提出了一个新的多任务乌尔都语场景文本数据集,包含超过1000张自然场景图像,可用于文本检测、识别和VQA任务。我们为文本实例提供了细粒度标注,解决了先前数据集在处理任意形状文本时的局限性。通过加入额外的标注点,该数据集有助于开发和评估能够处理现实场景中常见的多样化文本布局、复杂形状和非标准方向的方法。此外,VQA标注使其成为乌尔都语文本VQA方法的第一个基准,可以推动乌尔都语场景文本理解的发展。所提出的数据集可在https://github.com/Hiba-MeiRuan/Urdu-VQA-Dataset-/tree/main获取。
引用
@article{arxiv.2405.12533,
title = {Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering},
author = {Hiba Maryam and Ling Fu and Jiajun Song and Tajrian ABM Shafayet and Qidi Luo and Xiang Bai and Yuliang Liu},
journal= {arXiv preprint arXiv:2405.12533},
year = {2024}
}
备注
Accepted by the International Conference on Document Analysis and Recognition (ICDAR) 2024