QUATRO:面向LLM微调的查询自适应信任区域策略优化
机器学习
2026-02-09 v2
摘要
基于GRPO风格的强化学习(RL)LLM微调算法最近流行起来。然而,它们依赖于启发式信任区域近似,可能导致优化行为脆弱,因为全局重要性比率剪裁和组间归一化无法调节那些重要性比率超出剪裁范围的样本。我们提出查询自适应信任区域策略优化(QUATRO),通过原则化的优化直接强制执行信任区域约束。这产生了清晰且可解释的目标,使我们能够对策略更新实现显式控制和稳定的熵控制,并产生一种源于精确信任区域公式的稳定器项。在多个数学推理基准测试中进行的经验验证表明,QUATRO在增加策略滞后和激进学习率下仍能保持稳定训练,整个训练期间保持良好受控的熵。
引用
@article{arxiv.2602.04620,
title = {QUATRO: Query-Adaptive Trust Region Policy Optimization for LLM Fine-tuning},
author = {Doyeon Lee and Eunyi Lyou and Hyunsoo Cho and Sookyung Kim and Joonseok Lee and Jaemoo Choi},
journal= {arXiv preprint arXiv:2602.04620},
year = {2026}
}