评估大语言模型在混合上下文幻觉检测中的能力:基于摘要生成的视角
计算与语言
2025-03-04 v1 人工智能
计算机与社会
信息检索
机器学习
摘要
随着大语言模型 (LLM) 的快速发展, LLM 作为裁判器已成为用于文本质量评估, 包括幻觉评估的广泛采纳方法。虽然以往研究专注于单上下文评估 (如语义忠实度或世界事实性), 但现实中的幻觉通常涉及混合上下文, 这仍未得到充分评估。本研究以摘要生成为代表性任务, 全面评估 LLMs 在检测混合上下文幻觉方面的能力, 具体区分事实性幻觉与非事实性幻觉。通过规模不同的直接生成和检索式模型进行大量实验, 我们的主要发现是: (1) LLMs 的内在知识在幻觉评估中引入内在偏差; (2) 这些偏差尤其影响事实性幻觉的检测, 造成显著的性能瓶颈; (3) 根本挑战在于有效利用知识, 在 LLMs 的内在知识与外部上下文之间进行平衡, 以实现准确的混合上下文幻觉评估。
引用
@article{arxiv.2503.01670,
title = {Evaluating LLMs' Assessment of Mixed-Context Hallucination Through the Lens of Summarization},
author = {Siya Qi and Rui Cao and Yulan He and Zheng Yuan},
journal= {arXiv preprint arXiv:2503.01670},
year = {2025}
}
备注
8 pages, 5 figures for main body