中文

等等,这不是一个选项:LLM在多选题中应对错误选项的鲁棒性

计算与语言 2025-06-03 v3 人工智能

摘要

本工作引入了一种新型框架,用于评估LLM在包含无有效答案的多选题中,平衡遵循指令与批判性推理能力的表现。通过在算术、领域特定知识和高风险医疗决策任务上的系统评估,我们展示了后训练对齐模型常默认选择无效选项,而基座模型则展现出改进的拒绝能力,这种能力随模型规模而提升。我们的分析揭示,虽然对齐技术旨在增强有用性,但却无意中损害了模型的反思性判断——即在面对无效选项时能够超越默认行为的能力。我们 additionally 进行了平行的人类研究,显示类似的指令遵循偏差,这对这些偏差如何通过用于对齐的人类反馈数据集传播具有重要意义。我们提供了大量的消除实验,检验模型规模、训练技术和提示工程的影响。我们的发现凸显了对齐优化与保持批判性推理能力之间的根本性张力,对开发更可靠的AI系统以实现实际部署具有重要意义。

关键词

引用

@article{arxiv.2409.00113,
  title  = {Wait, that's not an option: LLMs Robustness with Incorrect Multiple-Choice Options},
  author = {Gracjan Góral and Emilia Wiśnios and Piotr Sankowski and Paweł Budzianowski},
  journal= {arXiv preprint arXiv:2409.00113},
  year   = {2025}
}

备注

Accepted for ACL 2025 Main Conference and NeurIPS 2024 FM-EduAssess Workshop