中文

基于符号反馈的LLM精细调优——RLSF

计算与语言 2026-02-27 v3 人工智能 机器学习 计算机科学中的逻辑

摘要

大型语言模型 (LLM) 已彻底改变了人工智能领域,但它们常常在需要领域特定推理和逻辑对齐的任务上感到困难。传统的精细调优方法并未利用我们通过符号推理工具(如定理证明器)获取的大量符号领域知识,而且还受限于奖励稀疏且不可靠的奖励模型的限制。我们提出了符号反馈强化学习 (RLSF),这是一种新的精细调优范式,其中符号推理工具(如求解器、定理证明器和代数系统)为 LLM 提供细粒度的反馈。RLSF 使用由符号工具生成的多项式大小的证书(如证明)来识别和纠正模型输出中的错误,提供基于标记的精确指导,而无需可微分的推理系统。这种范式填补了符号推理与 LLM 精细调优之间的鸿沟,使我们能够在保持领域特定约束的同时,对传统奖励信号的关键局限性进行了针对性解决。通过广泛的评估,我们展示了基于 RLSF 的 LLM 精细调优在五个不同应用(具有一定逻辑或领域约束)中超越了传统方法,包括:从自然语言伪代码到编程语言的程序合成、三个化学任务以及解24游戏。一个关键收获是,RLSF 使较小规模的 LLM 能够显著超过那些规模庞大数十倍的闭源模型。

关键词

引用

@article{arxiv.2405.16661,
  title  = {RLSF: Fine-tuning LLMs via Symbolic Feedback},
  author = {Piyush Jha and Prithwish Jana and Pranavkrishna Suresh and Arnav Arora and Vijay Ganesh},
  journal= {arXiv preprint arXiv:2405.16661},
  year   = {2026}
}