中文

何时何地提问:AskBench 与 Rubric-Guided RLVR 用于 LLM 澄清

计算与语言 2026-04-22 v2 机器学习

摘要

大语言模型 (LLM) 常常在提示缺乏关键细节或包含误导性信息时仍会作出回应,导致幻觉或强化错误认知。我们研究如何在不牺牲任务性能的前提下,评估和改进 LLM 的判断能力,以决定何时何地提问以获得澄清。我们引入 AskBench,一个交互式基准,将标准 QA 对转化为带有明确检查点的数据轮交互。统一的评判循环评估最终答案并根据需要模拟用户响应。AskBench 涵盖两种情形:AskMind 要求澄清的意图不足查询,以及 AskOverconfidence 包含错误前提必须被识别和纠正的查询。我们进一步提出基于验证器奖励的 Rubric-Guided 强化学习 (RLVR),使用结构化 Rubric 鼓励针对性澄清。实验表明,在准确性、Rubric 遵循度和交互效率方面均实现了持续的改进,并在未见领域中表现出强大的泛化能力。

关键词

引用

@article{arxiv.2602.11199,
  title  = {When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification},
  author = {Jiale Zhao and Ke Fang and Lu Cheng},
  journal= {arXiv preprint arXiv:2602.11199},
  year   = {2026}
}