用于基于图像的文本识别的多语言视频字幕数据集
计算机视觉与模式识别
2024-11-11 v1 人工智能
摘要
多语言视频字幕数据集是一个综合性集合,旨在支持跨多种语言的文本识别研究。该数据集包含从24个在线平台视频中提取的4,224幅字幕图像。它涵盖了广泛的字符,包括泰语辅音、元音、声调符号、标点符号、数字、罗马字符和阿拉伯数字。凭借157个独特字符,该数据集为应对复杂背景下的文本识别挑战提供了资源。它满足了日益增长的高质量多语言文本识别数据需求,特别是随着嵌入字幕的视频在YouTube和Facebook等平台上日益普及。这些图像中文本长度、字体和位置的多样性增加了复杂性,为开发和评估深度学习模型提供了宝贵的资源。该数据集促进了从视频内容中进行准确文本转录,同时为提升文本识别系统的计算效率奠定了基础。因此,它在推动包括人工智能、深度学习、计算机视觉和模式识别在内的多个计算机科学学科的研究与创新方面具有显著潜力。
引用
@article{arxiv.2411.05043,
title = {Multi-language Video Subtitle Dataset for Image-based Text Recognition},
author = {Thanadol Singkhornart and Olarik Surinta},
journal= {arXiv preprint arXiv:2411.05043},
year = {2024}
}
备注
12 pages, 5 figures