利用 LLM 与注意力机制对历史地图进行自动标注
计算机视觉与模式识别
2025-04-16 v1
摘要
历史地图是重要资源,提供过去地理景观的洞见。它们是历史、地理学和城市研究等多个学科研究者的有价值工具,便于重建历史环境并分析随时间的空间转换。然而,在模拟或扫描格式时,其解释仅限于人类,无法实现规模化。近期计算机视觉和大语言模型(LLM)的进展为自动识别和分类历史地图中的特征和对象开辟了新途径。本文提出一种新颖的蒸馏方法,利用 LLM 与注意力机制实现历史地图的自动标注。LLM 用于为低分辨率历史图像块生成粗糙分类标签,而注意力机制用于将这些标签细化至更高分辨率。实验结果表明,细化后的标签召回率超过 90%。此外,木头和定居点的交并比(IoU)分别为 84.2% 和 72.0%,精确率分别为 87.1% 和 79.5%,表明大多数标签与真实标注高度一致。值得注意的是,这些结果在训练时未使用细粒度手动标注,凸显了该方法在高效和可扩展的历史地图分析方面的潜力。
引用
@article{arxiv.2504.11050,
title = {Leveraging LLMs and attention-mechanism for automatic annotation of historical maps},
author = {Yunshuang Yuan and Monika Sester},
journal= {arXiv preprint arXiv:2504.11050},
year = {2025}
}