PowerFlow:通过原则化分布匹配释放LLM双重性质
计算与语言
2026-05-26 v2 人工智能
机器学习
摘要
从内部反馈进行无监督强化学习(RLIF)已成为从无外部监督中激发大型语言模型(LLM)潜在能力的有前景的方法。然而,现有方法依赖于启发式内在奖励,这些奖励往往缺乏明确定义的理论优化目标,容易受到偏差。本文我们引入PowerFlow,将无监督微调表述为分布匹配问题。通过将GFlowNet作为无归一化密度的 amortized变分抽样器,我们提出了长度感知的Trajectory-Balance目标,显式中和自回归生成中固有的结构长度偏差。通过针对α-幂分布,PowerFlow实现了对LLM双重性质的方向性激发:通过α>1加强分布以增强逻辑推理,或通过α<1平滑分布以释放表达性创造力。广泛的实验表明,PowerFlow consistently优于现有RLIF方法,匹配甚至超过监督的GRPO。Furthermore,通过缓解对齐模型中的过度加强,我们的方法在创意任务中同时实现了多样性和质量的提升,将创意任务的帕累托前沿向前移动。
引用
@article{arxiv.2603.18363,
title = {PowerFlow: Unlocking the Dual Nature of LLMs via Principled Distribution Matching},
author = {Ruishuo Chen and Yu Chen and Zhuoran Li and Longbo Huang},
journal= {arXiv preprint arXiv:2603.18363},
year = {2026}
}
备注
Camera-ready version accepted at ICML 2026