PaliBench:用于古典语言翻译基准的多参考蓝图
计算与语言
2026-05-19 v1
摘要
数字人文项目越来越依赖机器翻译和大型语言模型以拓宽对古典、宗教及其他翻译不足文本传统的访问。然而,标准翻译基准不太适合此类材料:它们通常将系统输出与单个参考翻译进行比较,尽管古典文本经常支持多个忠实的翻译版本,这些版本在术语、语域和解释方面有所不同。本文介绍PaliBench,既是一个用于巴利语至英语翻译的基准,也是一个用于构建古典语言多参考翻译基准的可复用方法。巴利语案例研究基于Sutta Pitaka中的段落与Bhikkhu Sujato、Bhikkhu Thanissaro和Bhikkhu Bodhi的独立英语翻译对齐。该工作流程结合LLM辅助对齐独立分段的翻译、对源文件进行自动验证、进行段落级质量过滤、消除公式化重复,以及针对多个人类参考进行多指标评估。 resulting benchmark 包含1700个段落,覆盖8389个 segment,约345,000个 token。我们用它评估十个当代大型语言模型,发现不同指标下的系统排名高度一致,同时可靠性和语义异常率存在显著差异。更广泛的贡献是方法论的:PaliBench表明如何将现有的学术翻译转化为解释性文本传统的评估基础,同时不将任何单个翻译视为唯一标准。虽然为巴利语佛教文本开发,方法也可移植到其他古典语料库,前提是存在足够的独立参考翻译。
引用
@article{arxiv.2605.16881,
title = {PaliBench: A Multi-Reference Blueprint for Classical Language Translation Benchmarks},
author = {Máté Metzger and Nadnapang Phophichit},
journal= {arXiv preprint arXiv:2605.16881},
year = {2026}
}
备注
Preprint. This manuscript has not yet been peer reviewed