十七世纪西班牙美洲公证记录:用于微调西班牙语大语言模型的资源
计算与语言
2024-06-11 v1 人工智能
摘要
大语言模型在电子商务、金融、医疗和教育等领域获得了巨大流行。微调是定制 LLM 应用于特定领域以完成特定下游任务的常见方法。本文提供了微调面向西班牙语大语言模型的资源,以完成分类、遮蔽语言模型、聚类等各种任务。我们的资源是来自阿根廷国家档案馆的十七世纪手写公证记录的集合。该集合包含原始图像与转录文本(及元数据)共计 160 多页,手写内容来自两位公证人:Estenban Agreda de Vergara 与 Nicolas de Valdivia y Brisuela,距今约 400 年。通过实证评估,我们展示了该集合可用于微调西班牙语 LLM 以完成分类和遮蔽语言模型等任务,可超越预训练的西班牙语模型以及 ChatGPT-3.5/ChatGPT-4o。该资源将是历史文本分析的宝贵资源,并已公开于 GitHub。
引用
@article{arxiv.2406.05812,
title = {Seventeenth-Century Spanish American Notary Records for Fine-Tuning Spanish Large Language Models},
author = {Shraboni Sarker and Ahmad Tamim Hamad and Hulayyil Alshammari and Viviana Grieco and Praveen Rao},
journal= {arXiv preprint arXiv:2406.05812},
year = {2024}
}