苏格拉底式学生:通过提问训练语言模型的学习能力
人工智能
2026-01-07 v4
摘要
大型语言模型 (LLM) 通常用于回答问题,但许多高风险应用(如辅导、临床支持)需要互补技能:检测缺失信息、请求澄清并利用这些信息来解决任务。我们研究的是推理密集型领域中的这一技能,这些领域的进展取决于询问而非事实记忆。在一个交互式协议中,学生模型在有限的回合预算下与更强的教师进行交互。在每个教师回复后,我们根据 Pass@k 对学生进行原始任务评估。我们提出了基于结果驱动的提问优化策略 (ODQS),一种从下游任务结果中学习提问策略的训练框架。在每个回合中,我们对多个候选提问进行采样;向教师查询每个提问,然后对学生随之产生的性能进行评分。利用这些评分,我们通过监督微调和直接偏好优化 (DPO) 训练学生,不需要任何人工标签。在 GSM8K、HumanEval 和 OpenCoder 上,ODQS 在交互式基线上实现显著提升,使 Pass@5 在数学领域提升最高可达 54.7%(绝对值),在编码领域提升 22.9%(绝对值),且在三个回合内实现基线性能。因此,提问可以从任务结果中显式训练,以提高交互式推理中的准确率和效率。
引用
@article{arxiv.2512.13102,
title = {Socratic Students: Teaching Language Models to Learn by Asking Questions},
author = {Rajeev Bhatt Ambati and Tianyi Niu and Aashu Singh and Shlok Mishra and Snigdha Chaturvedi and Shashank Srivastava},
journal= {arXiv preprint arXiv:2512.13102},
year = {2026}
}