利用生成式 AI 对数十年古籍进行分割与标注
计算机视觉与模式识别
2026-03-04 v1 信息检索
图像与视频处理
摘要
图像分割和图像识别是图像处理领域中已成熟的计算技术。分割用于定位图像中的区域,而识别则用于识别图像中的特定对象。尽管这些技术在现代图像上已展现出卓越的准确性,这主要是由于训练数据的广泛量。然而,在数百年来历文档的数字化图像上实现类似的准确性更具挑战性。这源于两个主要原因:其一是缺乏足够的训练数据,其二是特定领域的专业化程度较高。尽管如此,分割和识别这些收藏品中对象的能力对于自动化策展、编目和传播知识至关重要,这有助于使珍贵文献内容为学者和公众所掌握。在本文中,我们报告了关于对来自 16 和 17 世纪造船专著进行图像分割和标注的工作,这一历史时期被称为探索时代。为此,我们利用 SAM2 进行图像分割;利用 Florence2 和 ChatGPT 进行标注;以及名为 ontoShip 和 glossary glosShip 的专用航海建筑本体论来增强标注过程。初步结果表明,这些技术的结合有潜力用于提高珍贵历史文档的策展和检索。我们还讨论了在该方法中遇到的挑战和局限性,以及如何在未来克服这些困难的想法。
引用
@article{arxiv.2603.00147,
title = {Leveraging GenAI for Segmenting and Labeling Centuries-old Technical Documents},
author = {Carlos Monroy and Benjamin Navarro},
journal= {arXiv preprint arXiv:2603.00147},
year = {2026}
}
备注
6 pages, 7 figures