中文

衡量大语言模型在偏好排序中的不一致性

计算与语言 2024-10-14 v1

摘要

尽管大语言模型(LLMs)近期取得了显著进展,但其偏见和幻觉问题仍然存在,其提供一致偏好排序的能力尚未得到充分探索。本研究调查了LLMs提供一致序数偏好能力,尤其是在决策空间密集或缺乏绝对答案的场景中,这是一种关键特性。我们引入了基于序数理论的一致性形式化,概述了诸如传递性、非对称性、可逆性和独立于无关选择项的准则。我们的诊断实验在选定的状态-of-the-art LLMs上进行,结果显示它们无法满足这些准则,表明存在强烈的位置偏差和较差的传递性,偏好容易受到无关选择项的影响。这些发现凸显了LLM生成偏好排序的显著不一致性,强调了进一步研究以解决这些限制的必要性。

关键词

引用

@article{arxiv.2410.08851,
  title  = {Measuring the Inconsistency of Large Language Models in Preferential Ranking},
  author = {Xiutian Zhao and Ke Wang and Wei Peng},
  journal= {arXiv preprint arXiv:2410.08851},
  year   = {2024}
}

备注

In Proceedings of the 1st Workshop on Towards Knowledgeable Language Models (KnowLLM 2024)