中文

“勿教 Minerva”:借助 RAG 引导大语言模型穿越复杂句法以实现忠实的拉丁语翻译

计算与语言 2025-11-04 v1 数字图书馆

摘要

翻译像拉丁语这样形态丰富、低资源的语言面临重大挑战。本文提出一种可复现的“基于草稿的精炼”流水线( pipeline),可将开源大语言模型(LLM)的性能提升至与顶级专有系统在统计上可比的水平。我们的方法首先使用一个经过微调的 NLLB-1.3B 模型生成一个高质量、结构忠实的草稿;然后由一个零样本 LLM(Llama-3.3 或 Qwen3)对该草稿进行润色,这一过程可通过检索增强生成(RAG)补充上下文示例进一步增强。我们在两个不同的基准上验证了该方法的鲁棒性:一个标准的域内测试集(Rosenthal, 2023)以及一个新的、具有挑战性的、由 12 世纪拉丁语书信组成的域外(OOD)测试集(2025)。我们的核心发现是:该开源 RAG 系统在无需任何针对任务的 LLM 微调的情况下,即可取得与 GPT-5 基线在统计上可比的性能。我们发布了该流水线、Chartres 域外测试集以及评估脚本与模型,以促进可复现性与进一步研究。

关键词

引用

@article{arxiv.2511.01454,
  title  = {"Don't Teach Minerva": Guiding LLMs Through Complex Syntax for Faithful Latin Translation with RAG},
  author = {Sergio Torres Aguilar},
  journal= {arXiv preprint arXiv:2511.01454},
  year   = {2025}
}