中文

LiMe:中世纪晚期刑事判决拉丁语语料库

计算与语言 2025-08-01 v2

摘要

拉丁语一直受到计算语言学研究界的关注,多年来该社区构建了若干宝贵资源,涵盖从详细的标注语料库到复杂的语言学分析工具。随着大型语言模型的近期出现,研究人员也开始开发能够生成拉丁语文本向量表示的模型。由于可用数据的悬殊差异,此类模型的性能仍落后于现代语言的模型。在本文中,我们提出了 LiMe 数据集,该语料库包含从一系列名为 Libri sententiarum potestatis Mediolani 的中世纪手稿中提取的 325 份文档,并由专家进行了详尽标注,旨在用于掩码语言模型以及有监督自然语言处理任务。

关键词

引用

@article{arxiv.2404.12829,
  title  = {LiMe: a Latin Corpus of Late Medieval Criminal Sentences},
  author = {Alessandra Bassani and Beatrice Del Bo and Alfio Ferrara and Marta Mangini and Sergio Picascia and Ambra Stefanello},
  journal= {arXiv preprint arXiv:2404.12829},
  year   = {2025}
}