大语言模型的难题:低资源语言无参考翻译评估
计算与语言
2025-01-09 v1
摘要
本文探讨了机器翻译无参考评估问题,称为质量评估(QE)。分段级QE是一个具有跨语言理解挑战的任务,为翻译输出提供质量分数(0-100)。我们全面评估了大语言模型(LLM)在零/少样本情景下的表现,并使用基于注释指南的新颖提示进行指令微调。我们的结果表明,基于提示的方法被编码器-based微调QE模型所超越。我们的错误分析揭示了分词问题,以及由于转写和专有名词导致的错误,并为在跨语言任务中改进LLM预训练提出了建议。我们公开发布数据集和训练的模型供进一步研究使用。
引用
@article{arxiv.2501.04473,
title = {When LLMs Struggle: Reference-less Translation Evaluation for Low-resource Languages},
author = {Archchana Sindhujan and Diptesh Kanojia and Constantin Orasan and Shenbin Qian},
journal= {arXiv preprint arXiv:2501.04473},
year = {2025}
}