使用大语言模型进行低资源和高资源语言的机器翻译幻觉检测
计算与语言
2024-10-22 v3 人工智能
摘要
大规模多语言机器翻译系统的最新进展显著提升了翻译准确性;然而,即使是表现最好的系统仍会生成幻觉,严重影响用户信任。检测机器翻译中的幻觉仍是关键挑战,尤其是由于现有方法在高资源语言(HRLs)上表现出色,但在低资源语言(LRLs)上存在显著局限。本文评估了使用大语言模型(LLMs)和语义相似性在大规模多语言嵌入中的句子级幻觉检测方法。我们的研究涵盖 16 种语言方向,覆盖 HRLs、LRLs,以及不同脚本。我们发现模型选择对性能至关重要。在 HRLs 上,Llama3-70B 比以前的最佳方法平均提高了最高达 0.16 MCC( Matthews 相关系数)。然而,在 LRLs 上,我们观察到 Claude Sonnet 在其他 LLMs 中平均以 0.03 MCC 的优势表现。我们的研究的关键要点是,尽管大语言模型并未针对任何机器翻译任务进行显式训练,却能够实现与以前方法相当乃至更好的性能。然而,其优势在 LRLs 上不那么显著。
引用
@article{arxiv.2407.16470,
title = {Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Models},
author = {Kenza Benkirane and Laura Gongas and Shahar Pelles and Naomi Fuchs and Joshua Darmon and Pontus Stenetorp and David Ifeoluwa Adelani and Eduardo Sánchez},
journal= {arXiv preprint arXiv:2407.16470},
year = {2024}
}
备注
Authors Kenza Benkirane and Laura Gongas contributed equally to this work