等级评分:量化 LLM 在选项选择中的表现
人工智能
2024-06-24 v2
摘要
本研究提出了一种新型指标——"等级评分"(Grade Score),用于评估大型语言模型(LLM)在作为多选判断者时,关于顺序偏差和选项一致性的表现。等级评分为熵(衡量顺序偏差)和众数频率(评估选项稳定性)相结合,为了解 LLM 的可靠性和公正性提供了洞见。研究探讨了诸如提示工程和选项抽样策略等技术,以优化等级评分,展示了这些方法在增强 LLM 性能方面的有效性。结果显示,不同 LLM 在提示和选项方面的表现存在差异,并凸显了包括无关选项在内的正面影响。该研究还识别出指令跟随模型中的一种新现象,即它们会适应针对特定偏差的指令,从而显示出其适应性。等级评分为 LLM 之间的比较提供了可能性,并鼓励持续研究旨在优化其决策过程,以提高其在各种应用中的可靠性和公正性。所有代码已在 GitHub 上公开 \url{https://github.com/IoDmitri/GradeLab}。
引用
@article{arxiv.2406.12043,
title = {Grade Score: Quantifying LLM Performance in Option Selection},
author = {Dmitri Iourovitski},
journal= {arXiv preprint arXiv:2406.12043},
year = {2024}
}