中文

拉丁文文献间文本 similarity 检索的 Loci Similes 基准

信息检索 2026-01-30 v1 计算与语言 数字图书馆

摘要

追踪历史文本之间的联系是语文学研究的重要组成部分,使学者能够重建作家的虚拟图书馆并识别影响其创作过程的来源。这些间文本链接以多种形式呈现, ranging 从直接的逐字引用到通过形态变化掩饰的微妙暗示和改写。语言模型因其能够捕捉语义相似性而成为解决此问题的有前景的路径。然而,由于缺乏标准化基准和易于使用的数据集,新方法的开发受到阻碍。我们通过引入 Loci Similes,一个用于拉丁文间文本检测的基准,来弥补这一差距,该基准包含约 172k 条包含 545 项专家验证的平行文本片段,将后世古典作者与 Late Antique 作者关联起来。使用该数据,我们使用最先进的 LLM 为检索和分类建立了基线。

关键词

引用

@article{arxiv.2601.07533,
  title  = {Loci Similes: A Benchmark for Extracting Intertextualities in Latin Literature},
  author = {Julian Schelb and Michael Wittweiler and Marie Revellio and Barbara Feichtinger and Andreas Spitz},
  journal= {arXiv preprint arXiv:2601.07533},
  year   = {2026}
}