IntelliAsk:通过RLVR学习生成高质量研究问题
计算与语言
2026-03-09 v2 人工智能
摘要
同行评审依赖实质性、基于证据的问题,而当前LLM生成的表面级查询在专家评估中表现不如人类评审的问题。为此,我们构建了来自OpenReview的高质量评审问题数据集,并开展了人类偏好研究,其中专家标注者在三个维度上评估问题-论文对: effort(努力程度)、evidence(证据)和grounding( grounding)。据此,我们训练了IntelliReward——一个基于冻结自回归LLM并带可训练多头Transformer的奖励模型。验证结果表明,IntelliReward在预测评审问题质量方面优于基于API的SFT基线,提供了可扩展的评估。我们应用Decoupled Clip和Dynamic Sampling Policy Optimization(DAPO)结合IntelliReward,以训练IntelliAsk——一个符合人类标准的、注重努力程度、基于证据的批判性问题生成模型。人类评估显示,IntelliAsk生成的提问更具 grounding、实质性和努力程度,优于强大基线,减少了对第一页内容的依赖。我们也发现其在推理和写作基准上的提升,表明评审问题质量与更广泛的能力呈正相关。相较于Qwen3-32B,IntelliAsk在MuSR(68.3% vs 64.7%)和WritingBench(8.31 vs 8.07)上取得改进。我们发布代码、过滤后的评审数据集、专家标注、IntelliAsk和IntelliReward,以支持自动评估LLM生成评审问题中grounding、effort和evidence的质量。
引用
@article{arxiv.2602.15849,
title = {IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR},
author = {Karun Sharma and Vidushee Vats and Shengzhi Li and Yuxiang Wang and Zhongtian Sun and Prayag Tiwari},
journal= {arXiv preprint arXiv:2602.15849},
year = {2026}
}
备注
24 Pages, v2, Abstract Modified