中文

OnionEval:小型大型语言模型事实冲突幻觉的统一评估

计算与语言 2025-01-23 v1

摘要

大型语言模型 (LLM) 能力强大,但在训练和推理方面都需要大量的计算资源。在 LLM 家族中,较小的模型(参数量少于 100 亿的模型)在各种任务中也表现良好。然而,这些较小的模型与其较大的同类模型有相似的局限性,包括产生幻觉的倾向。尽管存在许多评估 LLM 幻觉的基准,但很少有专门针对小型 LLM (SLLM) 的。此外,SLLM 在不同基准测试中的表现差异很大。在本文中,我们介绍了 OnionEval,这是一个多层结构框架,带有一种称为上下文影响分数 (CI) 的特定指标,旨在有效评估小型 LLM 在不同上下文级别下的事实冲突幻觉倾向。我们的实验结果揭示了 SLLM 的一个关键特征:它们擅长事实分析,但在上下文推理方面面临挑战。进一步的研究表明,简单的思维链策略可以显著减少这些局限性,提高 SLLM 在实际应用中的实用性。

关键词

引用

@article{arxiv.2501.12975,
  title  = {OnionEval: An Unified Evaluation of Fact-conflicting Hallucination for Small-Large Language Models},
  author = {Chongren Sun and Yuran Li and Di Wu and Benoit Boulet},
  journal= {arXiv preprint arXiv:2501.12975},
  year   = {2025}
}