评估评估指标——幻觉检测的幻象
计算与语言
2025-10-10 v2 人工智能
机器学习
摘要
幻觉是语言模型可靠性和广泛采用的重要障碍,但其准确测量仍是持续挑战。虽然已提出多种任务和领域特定的指标来评估忠实性和事实性问题,但这些指标的鲁棒性和泛化能力仍未得到检验。本文对6套多样化的幻觉检测指标进行大规模实证评估,涵盖4个数据集、37个来自5个家族的语言模型,以及5种解码方法。我们的广泛调查揭示了当前幻觉评估的 concerning gaps:指标常常不与人类判断一致,过于片面地审视问题,且在参数规模提升时表现不稳定。令人鼓舞的是,基于LLM的评估,特别是使用GPT-4,综合效果最佳,模式寻求解码方法似乎能减少幻觉,尤其在知识 grounding 设置下效果更佳。这些发现凸显了需要更健壮的指标来理解和量化幻觉,以及更好的策略来缓解幻觉的重要性。
引用
@article{arxiv.2504.18114,
title = {Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection},
author = {Atharva Kulkarni and Yuan Zhang and Joel Ruben Antony Moniz and Xiou Ge and Bo-Hsiang Tseng and Dhivya Piraviperumal and Swabha Swayamdipta and Hong Yu},
journal= {arXiv preprint arXiv:2504.18114},
year = {2025}
}
备注
Accepted at EMNLP 2025 Findings (Short)