基于大型视觉语言模型的考古目录收集方法
计算机视觉与模式识别
2024-12-31 v1 人工智能
摘要
考古目录包含文物图像、形态描述和挖掘信息等关键要素,对于研究文物演化和文化传承至关重要。但这些数据广泛散落在各类出版物中,亟需自动化收集方法。然而,现有的大型视觉语言模型(Large Vision-Language Models, VLM)及其衍生数据收集方法在处理考古目录时,面临图像检测和模态匹配不准确的挑战,难以实现自动化收集。为此,我们提出一种基于大型视觉语言模型的考古目录收集方法,包含三个模块:文档定位、块级理解与块级匹配。通过对豆岗窑器目录和妙子沟陶器目录的实际数据收集与对比实验,证明了该方法的有效性,为考古目录的自动化收集提供了可靠解决方案。
引用
@article{arxiv.2412.20088,
title = {An archaeological Catalog Collection Method Based on Large Vision-Language Models},
author = {Honglin Pang and Yi Chang and Tianjing Duan and Xi Yang},
journal= {arXiv preprint arXiv:2412.20088},
year = {2024}
}
备注
4 pages,4 figures,www source track