中文

超越解题数学测验:评估大规模推理模型请求信息的能力

人工智能 2025-08-18 v1 计算与语言 信息检索

摘要

大规模推理模型 (LRM) 在数学中展示了惊人的解决能力,已被评估于仅限于明确定义问题的基准。然而,这种评估 setup 仍存在关键缺口,因为真正的智能体不仅应能解题(如数学测验解答者),还应能在问题缺乏足够信息时主动请求信息,从而提前回应用户请求。为填补这一差距,我们提出了包含两种多样化上下文中不完整问题的数据集。基于该数据集,我们系统性地评估了 LRMs 在主动请求信息方面的能力不足。此外,我们揭示了 LRMs 相关的过度思考和幻觉行为,并强调了监督微调在学习此类能力方面的潜力与挑战。我们希望为开发具有真正智能的 LRM 提供新见解,而不仅仅是解题问题。

关键词

引用

@article{arxiv.2508.11252,
  title  = {Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information},
  author = {Youcheng Huang and Bowen Qin and Chen Huang and Duanyu Feng and Xi Yang and Wenqiang Lei},
  journal= {arXiv preprint arXiv:2508.11252},
  year   = {2025}
}