立场论文:元数据增强模型:面向文化遗产应用的神经网络与语义知识图谱整合
计算机视觉与模式识别
2025-05-30 v1
摘要
文化遗产藏品的数字化开辟了新的研究方向,然而缺乏增强的元数据对可访问性、互操作性和跨机构协作构成了重大挑战。在过去几年中,诸如 YOLOv11 和 Detectron2 等神经网络模型彻底改变了视觉数据分析,但它们在特定领域文化人工制品(如手稿和摇篮本)中的应用,仍因缺乏解决结构特征提取和语义互操作性的方法论而受到限制。在这篇立场论文中,我们论证了神经网络与语义技术的整合代表了文化遗产数字化过程的范式转变。我们提出了元数据增强模型 (MEM),这是一个概念框架,旨在通过结合微调的计算机视觉模型、大型语言模型 (LLM) 和结构化知识图谱来为数字化藏品增强元数据。多层视觉机制 (MVM) 是 MEM 的关键创新。这一迭代过程通过动态检测嵌套特征(如印章内的文本或邮戳内的图像)来改进视觉分析。为了展示 MEM 的潜力,我们将其应用于来自雅盖隆数字图书馆的数字化摇篮本数据集,并发布了包含 105 页手稿的人工标注数据集。我们考察了在真实世界的 GLAM 机构中使用 MEM 的实际挑战,包括特定领域微调的需求、使用 Linked Data 标准调整增强元数据以及计算成本。我们将 MEM 作为一种灵活且可扩展的方法论提出。本文有助于探讨人工智能和语义网技术如何推动文化遗产研究,并在实践中应用这些技术。
引用
@article{arxiv.2505.23543,
title = {Position Paper: Metadata Enrichment Model: Integrating Neural Networks and Semantic Knowledge Graphs for Cultural Heritage Applications},
author = {Jan Ignatowicz and Krzysztof Kutt and Grzegorz J. Nalepa},
journal= {arXiv preprint arXiv:2505.23543},
year = {2025}
}