BullingerDB:用于手写文字识别和作家检索的数据集
计算机视觉与模式识别
2026-05-29 v1
摘要
我们提出 BullingerDB,这是一个基于海因里希·布利格纳(Heinrich Bullinger,1504-1575)书信的历史文档分析大规模基准数据集。该语料库包含20,898页和499,222行文字,由796位作家在六个世纪中书写,具有风格多样性、多语言内容(主要为拉丁文和早期新德语)以及作家身份和时间等元信息。我们在文本识别和作家检索上对 BullingerDB 进行评估。最佳-performing模型 TrOCR 实现了9.1%的字符错误率(CER)。对于作家检索,我们引入时间nDCG指标以评估时间感知检索。虽然实现了时间一致性检索,mAP(78.3%)的得分表明由于长期风格变化仍面临挑战。我们希望通过 BullingerDB 建立一个新的基准,用于多语言历史文本识别和时间感知作家分析。
关键词
引用
@article{arxiv.2605.30235,
title = {BullingerDB: A Dataset for Handwritten Text Recognition and Writer Retrieval},
author = {Marco Peer and Anna-Scius Bertrand and Patricia Scheurer and Andreas Fischer},
journal= {arXiv preprint arXiv:2605.30235},
year = {2026}
}
备注
Accepted for presentation at ICDAR2026. Dataset available via zenodo