大语言模型检测历史书籍中的拉丁文:一个多模态基准
计算与语言
2026-02-09 v3 人工智能
计算机视觉与模式识别
数字图书馆
摘要
本文提出了一个从混合语言历史文件中提取低资源且噪声较大的拉丁文碎片的新任务。我们对大型基础模型在包含724个标注页面的多模态数据集上进行基准测试和评估。结果表明,即使是当代零样模型也能实现可靠的拉丁文检测,但这些模型缺乏对拉丁文的功能性理解。该研究为处理混合语言语料库中的拉丁文,支持智识史和历史语言学中的定量分析,提供了全面的基准。数据集和代码均已公开于https://github.com/COMHIS/EACL26-detect-latin。
引用
@article{arxiv.2510.19585,
title = {Detecting Latin in Historical Books with Large Language Models: A Multimodal Benchmark},
author = {Yu Wu and Ke Shu and Jonas Fischer and Lidia Pivovarova and David Rosson and Eetu Mäkelä and Mikko Tolonen},
journal= {arXiv preprint arXiv:2510.19585},
year = {2026}
}
备注
Accepted by the EACL 2026 main conference. Code and data available at https://github.com/COMHIS/EACL26-detect-latin