自问自答语言模型
机器学习
2025-09-11 v4 人工智能
摘要
大型语言模型能否通过生成自己的问题和答案来实现自我提升?我们假设,给定仅指定主题(例如代数单词问题)的单个提示,并要求模型生成自己的问题,即可提升预训练语言模型的推理能力。为此,我们提出了自问语言模型(SQLM):一种非对称的自我对弈框架,其中提议者给定主题并生成问题,求解者尝试回答。提议者和求解者都通过强化学习进行训练。提议者若问题难度适中(既不太容易也不太难)则获得奖励,求解者则根据多数投票获得奖励,这是一种在缺乏真实答案的情况下用于衡量正确性的代理方法。对于编程任务,提议者可以生成单元测试用于验证。我们在三个基准上研究这种非对称自我对弈框架:三位数乘法、来自OMEGA基准的代数问题以及来自Codeforces的编程问题。通过不断生成更有趣的问题并尝试解决它们,语言模型无需访问任何精选训练数据集即可在下游基准上取得改进。
引用
@article{arxiv.2508.03682,
title = {Self-Questioning Language Models},
author = {Lili Chen and Mihir Prabhudesai and Katerina Fragkiadaki and Hao Liu and Deepak Pathak},
journal= {arXiv preprint arXiv:2508.03682},
year = {2025}
}