面向古希腊纸草学与碑铭学的预训练因果语言模型指令微调
摘要
本文提出了一项微调预训练因果语言模型(Meta 的 Llama 3.1 8B Instruct)的实验,旨在协助修复古希腊碑铭和文献纸草中缺失或难以辨认的字符。利用直接的基于指令的方法和 95%/5% 的训练/测试划分,纸草修复模型在长达 10 个字符的序列上实现了 14.9% 的字符错误率(CER)、73.5% 的 top-1 准确率和 86.0% 的 top-20 准确率。此外,我们还微调了一个用于地理归因的模型,达到了 66.4% 的 top-1 准确率和 79.9% 的 top-3 准确率。在年代归因方面,其与实际 terminus post/ante quem 的平均偏差为 21.7 年,中位数偏差为 0 年。对于碑铭,修复模型在长达 10 个字符的序列上实现了 20.5% 的 CER、63.7% 的 top-1 准确率和 83.0% 的 top-20 准确率。在地理归因方面,它达到了 75.0% 的 top-1 准确率和 83.7% 的 top-3 准确率;而在年代测定方面,其与实际日期范围的平均偏差为 37.1 年,中位数偏差为 3 年。在共享测试集和最近编辑的碑铭上与 SOTA 模型(Ithaca)进行基准测试,结果表明指令微调模型在文本修复方面表现出色,同时在重建过程中具有忽略空格的实际优势,这与古代文本文物的连续书写相吻合。然而,它们在地理和年代归因方面的表现低于 Ithaca。为了在更均衡的设置下评估该方法,我们使用 80%/10%/10% 的训练-验证-测试划分重新训练了指令模型,其在文本修复方面仍然优于 Ithaca。结果表明,使用指令模板对古代文本进行校订和推测,对更大的预训练因果语言模型进行微调具有广阔前景。
引用
@article{arxiv.2409.13870,
title = {Instruct-Tuning Pretrained Causal Language Models for Ancient Greek Papyrology and Epigraphy},
author = {Eric Cullhed},
journal= {arXiv preprint arXiv:2409.13870},
year = {2024}
}
备注
9 pages, 1 table. To be submitted