中文

反馈指数:评估LLM对选择题反驳回答的框架

物理教育 2026-01-08 v1 人工智能

摘要

我们提出了一套系统的指数框架,用于表征大型语言模型(LLM)在聊天中面对反驳时的响应行为。评估LLMs如何回应用户的异议对于理解其可靠性和行为模式至关重要,但人机交互的复杂性使得系统性评估具有挑战性。我们的方法采用虚构响应反驳法,量化LLM在面对选择题后对其虚构先前响应的刻意挑战时的行为。这些指数专门设计用于检测和衡量LLM可能表现出的谄媚行为(过度同意用户挑战)或固执行为(rigid adherence to the fictitious response in the chat history)。这些指标允许研究谄媚性、固执性与模型对学科内容的实际掌握之间的关系。我们使用两个物理问题作为测试场景,结合多种OpenAI模型展示了这些指数的效用。该框架有意可泛化到任何选择题格式的问题,包括在没有普遍公认正确答案的主题上。我们的结果揭示了OpenAI模型代际之间的可测量差异,趋势表明更新的模型和采用更大"推理努力"的模型表现出减少的谄媚行为。FR配对方法结合我们提出的指数为系统性地比较不同模型和上下文中的LLM对话行为提供了一个实用、可适应的工具包。

关键词

引用

@article{arxiv.2601.03285,
  title  = {Feedback Indices to Evaluate LLM Responses to Rebuttals for Multiple Choice Type Questions},
  author = {Justin C. Dunlap and Anne-Simone Parent and Ralf Widenhorn},
  journal= {arXiv preprint arXiv:2601.03285},
  year   = {2026}
}