RASPRef:检索增强的自监督式提示优化框架用于大型推理模型
计算机科学中的逻辑
2026-04-07 v2
摘要
近期类似DeepSeek R1和OpenAI o1此类以推理为导向的大型语言模型,在GSM8K、MATH以及多跳问答任务等结构化推理基准上表现突出。然而,其性能对提示措辞高度敏感,设计有效提示通常是手动且迭代的过程,难以在不同任务或领域之间扩展。为此,我们提出检索增强自监督式提示优化框架(RASPRef),该框架无需人工标注或任务特定监督即可改进提示。该方法检索相关示例和先前生成的推理轨迹,利用如多样本一致性、验证器反馈和模型生成的批评等信号,对提示进行迭代式优化。与先前侧重于改进模型输出的方法不同,RASPRef直接将提示作为优化目标,通过迭代检索引导的优化过程来提升其性能。在GSM8K风格的数学推理任务实验中,检索引导的提示优于静态提示基线。我们进一步讨论了检索质量、轨迹选择以及自监督反馈信号如何影响提示优化的有效性。这些发现表明,提示设计仍是推理导向语言模型的关键因素,而自我改进的提示为提升推理性能提供了实用且可扩展的策略。
引用
@article{arxiv.2603.27007,
title = {Pairwise Independence of Representation, Classification, and Composition in Finite Extensional Magmas},
author = {Stefano Palmieri},
journal= {arXiv preprint arXiv:2603.27007},
year = {2026}
}