从事实到判断:探究任务框架对LLM信念 conviction 的影响
计算与语言
2026-01-12 v2
摘要
LLM正越来越多地被用作各种任务的裁判,其中包括涉及日常社交互动的任务。然而,人们仍不清楚此类LLM裁判是否能可靠地评估需要社交或对话判断的任务。我们研究了当任务从直接事实查询重新框定为对话判断任务时,LLM信念会发生何种变化。我们的评估框架对比了模型在直接事实查询上的表现与其在最小对话情境中对说话者正确性的评估,即从“此陈述是否正确?”转为“此说话者是否正确?”。此外,我们施加一种简单反驳(“上一个答案是错误的。”)以两者。这种扰动允许我们衡量模型在对话压力下坚持立场的力度。我们的发现表明,尽管某些模型如GPT-4o-mini在社交框架任务中表现出迎合性倾向,而其他模型如Llama-8B-Instruct则显得过于苛刻。我们观察到所有模型平均性能变化为9.24%,这表明即使很小的对话背景也会显著改变模型的判断,强调对话框架在LLM评估中是一个关键因素。该提出的方法论框架为诊断模型信念提供了可重复的方法,促进了更可信赖的对话系统开发。
引用
@article{arxiv.2511.10871,
title = {From Fact to Judgment: Investigating the Impact of Task Framing on LLM Conviction in Dialogue Systems},
author = {Parisa Rabbani and Nimet Beyza Bozdag and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2511.10871},
year = {2026}
}
备注
11 pages, 3 figures