翻译任务中的不确定性可视化:LLM性能与置信度指标评估
摘要
大型语言模型(LLM)日益被用于机器翻译,但其预测常常表现出不确定性,影响可解释性和用户信任。有效地可视化这些不确定性可提升LLM输出的实用性,尤其是在翻译准确性至关重要的场景中。本文旨在实现两个主要目标:(1)为用户提供模型置信度的token级洞察,(2)开发基于Web的数据可视化工具以量化和呈现翻译不确定性。为实现这些目标,我们使用WMT19数据集上的T5模型进行翻译任务,并采用BLEU、METEOR和ROUGE等既定指标评估翻译质量。我们引入了三个新的不确定性量化(UQ)指标:(1)token概率的几何平均数,(2)token概率的算术平均数,(3)token分布峰度的算术平均数。这些指标为评估翻译性能提供了简单而有效的框架。我们的分析显示,传统评估指标与我们的UQ指标之间存在线性关系,证明了我们方法的有效性。此外,我们开发了基于交互式Web的数据可视化工具,使用颜色渐变表示token置信度。该工具为用户提供了清晰直观的翻译质量理解,同时为模型性能提供了宝贵洞察。总体而言,我们表明我们的UQ指标和可视化工具既稳健又可解释,为评估和评估机器翻译系统提供了实用工具。
引用
@article{arxiv.2501.17187,
title = {Visualizing Uncertainty in Translation Tasks: An Evaluation of LLM Performance and Confidence Metrics},
author = {Jin Hyun Park and Utsawb Laminchhane and Umer Farooq and Uma Sivakumar and Arpan Kumar},
journal= {arXiv preprint arXiv:2501.17187},
year = {2025}
}
备注
We would like to withdraw our paper due to an error in the experimental methodology, which impacts the validity of our results. The error specifically affects the analysis presented in the Discussion, where an incorrect experimental modeling step led to misleading interpretations