中文

面向档案自动化与语义元数据丰富的AI驱动模块化管线——Vidya

数字图书馆 2026-05-19 v1 计算与语言

摘要

大规模数字化历史档案的创建造成了悖论:“dark data”——缺乏检索元数据的数字对象。手动档案描述耗时且昂贵,限制了发现与重用。我们提出Vidya,一种模块化管线,通过编排大型语言模型(LLM)和自由软件工具实现语义丰富化与档案摄取的自动化。Vidya利用YAML定义的本体和Pydantic验证约束生成,产生来自概率模型的确定性结构JSON输出。Vidya由巴西东部部落格大学(UEPG)的数字人文与创新实验室(LAMUHDI)开发,采用Maker原则和开源实践,实现低成本部署,适用于在有限硬件资源的记忆机构。我们比较了LLM性能并呈现成本效益分析,显示主要收益:将处理时间从数十年缩短至数天,同时符合NOBRADE和ISAD(G)标准。

关键词

引用

@article{arxiv.2605.16338,
  title  = {Vidya: An AI-Driven Modular Pipeline for Archival Automation and Semantic Metadata Enrichment},
  author = {Cloter Migliorini Filho and Julia Graciela Machado and Edson Armando Silva and Marcella Scoczynski},
  journal= {arXiv preprint arXiv:2605.16338},
  year   = {2026}
}