ClapperText:面向低资源档案文件中文本识别的基准数据集
计算机视觉与模式识别
2025-10-20 v1 人工智能
图像与视频处理
摘要
本文提出了 ClapperText,一个用于手写和打印文本识别在视觉降解和低资源环境中的基准数据集。该数据集来源于包含记录生产元数据(如日期、地点和摄影师身份)的 127 段二战时期档案视频片段中的指挥棍。ClapperText 包含 9,813 个标注帧和 94,573 个单词级文本实例,其中 67% 为手写文本,1,566 个部分被遮挡。每个实例包括转录文本、语义类别、文本类型和遮挡状态,标注以旋转边界框形式呈现为 4 点多边形,以支持精确定位的 OCR 应用。识别指挥棍文本面临显著挑战,包括运动模糊、手写体变化、曝光波动和杂乱背景,这反映了历史文件分析中结构化内容在降解、非标准形式中出现的更广泛挑战。我们提供了完整帧标注和裁剪单词图像,以支持下游任务。采用一致的 per-video 评估协议,我们对六个代表性识别模型和七个检测模型进行了零样本和微调条件下的基准测试。尽管训练集较小(仅 18 个视频),但微调显著提升性能,凸显 ClapperText 在少样本学习场景中的适用性。该数据集提供了一个真实且文化背景浓厚的资源,用于推动低资源档案情境下鲁棒 OCR 和文档理解技术的发展。数据集和评估代码已提供于 https://github.com/linty5/ClapperText。
引用
@article{arxiv.2510.15557,
title = {ClapperText: A Benchmark for Text Recognition in Low-Resource Archival Documents},
author = {Tingyu Lin and Marco Peer and Florian Kleber and Robert Sablatnig},
journal= {arXiv preprint arXiv:2510.15557},
year = {2025}
}
备注
18 pages, accepted at ICDAR2025 DALL