Fetch-A-Set:面向历史文档检索的大规模无OCR基准
信息检索
2024-06-18 v2 计算机视觉与模式识别
摘要
本文介绍了Fetch-A-Set(FAS),一个专为立法历史文档分析系统设计的综合基准,旨在应对历史背景下大规模文档检索的挑战。该基准包含一个可追溯至17世纪的海量文档库,既可作为训练资源,也可作为检索系统的评估基准。它通过聚焦文化遗产领域中的复杂抽取任务,填补了文献中的一个关键空白。所提出的基准解决了历史文档分析的多方面问题,包括查询的文本到图像检索以及文档片段的图像到文本主题提取,同时适应了不同水平的文档可读性。该基准旨在通过提供基线和数据,促进鲁棒历史文档检索系统的开发和评估,特别是在具有广泛历史跨度的场景中。
引用
@article{arxiv.2406.07315,
title = {Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval},
author = {Adrià Molina and Oriol Ramos Terrades and Josep Lladós},
journal= {arXiv preprint arXiv:2406.07315},
year = {2024}
}
备注
Preprint for the manuscript accepted for publication in the DAS2024 LNCS proceedings