利用LLM和RAG自动化分类Iconclass:面向宗教woodcut的大规模分类
信息检索
2025-10-24 v1 计算机视觉与模式识别
摘要
本文提出了一种新方法,用于对早期现代宗教图像进行分类,方法采用大型语言模型(LLM)和向量数据库结合检索增强生成(RAG)。该方法利用来自神罗明王国的完整书稿插图上下文,使LLM能够生成包含视觉和文本元素的详细描述。然后,通过混合向量搜索将这些描述与相关的Iconclass代码匹配。该方法在五级和四级分类精度分别达到87%和92%,显著优于传统的图像和关键词搜索。通过采用完整的页面描述和RAG,该系统提高了分类精度,为大规模分析早期现代视觉档案库提供了强大的工具。这种跨学科方法表明,LLM和RAG在推动艺术史和数字人文研究方面的潜力日益增长。
引用
@article{arxiv.2510.19986,
title = {Automating Iconclass: LLMs and RAG for Large-Scale Classification of Religious Woodcuts},
author = {Drew B. Thomas},
journal= {arXiv preprint arXiv:2510.19986},
year = {2025}
}
备注
29 pages, 7 figures. First presented at the "Digital Humanities and Artificial Intelligence" conference at the University of Reading on 17 June 2024