面向档案自动化与语义元数据丰富的AI驱动模块化管线——Vidya
数字图书馆
2026-05-19 v1 计算与语言
摘要
大规模数字化历史档案的创建造成了悖论:“dark data”——缺乏检索元数据的数字对象。手动档案描述耗时且昂贵,限制了发现与重用。我们提出Vidya,一种模块化管线,通过编排大型语言模型(LLM)和自由软件工具实现语义丰富化与档案摄取的自动化。Vidya利用YAML定义的本体和Pydantic验证约束生成,产生来自概率模型的确定性结构JSON输出。Vidya由巴西东部部落格大学(UEPG)的数字人文与创新实验室(LAMUHDI)开发,采用Maker原则和开源实践,实现低成本部署,适用于在有限硬件资源的记忆机构。我们比较了LLM性能并呈现成本效益分析,显示主要收益:将处理时间从数十年缩短至数天,同时符合NOBRADE和ISAD(G)标准。
引用
@article{arxiv.2605.16338,
title = {Vidya: An AI-Driven Modular Pipeline for Archival Automation and Semantic Metadata Enrichment},
author = {Cloter Migliorini Filho and Julia Graciela Machado and Edson Armando Silva and Marcella Scoczynski},
journal= {arXiv preprint arXiv:2605.16338},
year = {2026}
}