基于性格与置信度的判断:大语言模型相关性评估的人格条件研究
计算与语言
2026-01-06 v1 信息检索
摘要
近期研究表明,通过提示可以使大型语言模型(LLM)模拟特定的性格特征并产生与这些特征相符的行为。然而,如何这些模拟的人格影响关键网络搜索决策,特别是相关性评估,仍鲜为人知。此外,少数研究探讨了模拟人格对置信度校准的影响,即对过度自信或不自信倾向的影响。即便心理学文献表明这些偏差是性格特有的,高外向性与过度自信、高神经质与不自信常有关联。为填补这一空白,我们进行了一项全面研究,评估了多种 LLM,包括商业模型和开源模型,这些模型被设置为模拟大五人格性格。我们在三个测试集合(TREC DL 2019、TREC DL 2020 和 LLMJudge)上进行测试,为每个查询-文档对收集两个关键输出:相关性判断和自报告置信度分数。研究结果表明,诸如低同意心等性格持续更贴近人类标签,而不进行提示的条件则表现较差。此外,低勤勉性在抑制过度自信和不自信双方面方面表现良好。我们还观察到相关性分数和置信度分布在不同性格之间呈系统性变化。基于上述发现,我们将性格条件化分数和置信度作为特征纳入随机森林分类器。该方法在新数据集(TREC DL 2021)上性能超过最佳单一性格条件,即便训练数据有限。这些发现表明,性格派生的置信度提供了补充的预测信号,为构建更可靠且符合人类取向的 LLM 评估器铺平了道路。
引用
@article{arxiv.2601.01862,
title = {Judging with Personality and Confidence: A Study on Personality-Conditioned LLM Relevance Assessment},
author = {Nuo Chen and Hanpei Fang and Piaohong Wang and Jiqun Liu and Tetsuya Sakai and Xiao-Ming Wu},
journal= {arXiv preprint arXiv:2601.01862},
year = {2026}
}