中文

好计划难求:模型与偏好的对齐与对用户实际帮助的错位

计算与语言 2025-09-24 v1

摘要

为了帮助用户完成复杂任务,LLM 会生成计划:达成目标的分步指令。虽然对齐方法旨在确保 LLM 计划是有帮助的,但它们基于用户偏好进行训练(RLHF)或评估(ChatbotArena),假设这反映了什么对用户有帮助。我们用 Planorama 测试了这一点:这是一个界面,126 名用户使用 LLM 计划回答了 300 个多步问题。我们获得了 4388 次计划执行和 5584 次比较,以衡量计划帮助性(问答成功)和用户对计划的偏好,并在智能体和奖励模型中重现了该设置,以观察它们是否模拟或偏好对用户有帮助的内容。我们发现:1)用户/模型偏好和智能体成功率不能准确预测哪些计划对用户有帮助,因此常见的对齐反馈可能与帮助性错位;2)这一差距并非由于用户特定偏好所致,因为用户在使用他们偏好/不偏好的计划时同样成功;3)简短和问题相似性等表层线索与偏好强烈相关,但此类偏差无法预测帮助性。总而言之,我们认为对齐有帮助的 LLM 需要来自真实用户交互的反馈,而不仅仅是看起来有帮助的偏好,因此我们讨论了 NLP 研究人员可以执行以解决此问题的计划。

关键词

引用

@article{arxiv.2509.18632,
  title  = {A Good Plan is Hard to Find: Aligning Models with Preferences is Misaligned with What Helps Users},
  author = {Nishant Balepur and Matthew Shu and Yoo Yeon Sung and Seraphina Goldfarb-Tarrant and Shi Feng and Fumeng Yang and Rachel Rudinger and Jordan Lee Boyd-Graber},
  journal= {arXiv preprint arXiv:2509.18632},
  year   = {2025}
}

备注

EMNLP 2025