RLearner-LLM:通过混合直接偏好优化平衡大型语言模型的逻辑基础与流畅性
计算与语言
2026-05-13 v3 人工智能
摘要
直接偏好优化(DPO)作为基于PPO的RLHF的高效替代方案,在知识密集型生成任务上存在不足:来自人类标注者或LLM评判器的标准偏好信号表现出系统性的冗长偏差,即奖励流畅性而非逻辑正确性。这一盲区留下了逻辑对齐鸿沟——SFT模型尽管能生成流畅的文本,但其NLI蕴含率仅为0.05-0.22。我们提出了RLearner-LLM与Hybrid-DPO:一个自动化的偏好流水线,将DeBERTa-v3 NLI信号与验证器LLM评分相融合,在消除人类标注的同时克服了单信号优化的“对齐税”。在五个学术领域(生物学、医学、法学)和三种基础架构(LLaMA-2-13B、Qwen3-8B、Gemma 4 E4B-it)上进行评估,RLearner-LLM相比SFT实现了高达6倍的NLI提升,在15个测试单元中的11个取得了NLI增益,并保持一致的答案覆盖率提升。在Gemma 4 E4B-it(45亿有效参数)上,Hybrid-DPO在五个领域中的四个提升了NLI(+11.9%至+2.4倍),并在所有五个领域中实现了更快的推理速度,在缩减至紧凑基础模型的同时保持了对齐税缓解。我们的Qwen3-8B RLearner-LLM在与自身SFT基线的成对比较中胜率达95%;而GPT-4o-mini反过来以95%的胜率击败我们的简洁输出——加上同一评判器判定冗长SFT以69%的胜率击败我们的DPO模型,这在前沿比较器上复现了冗长偏差,并促使在知识密集型生成中采用逻辑感知指标(NLI、ACR)而非LLM-as-a-judge。
引用
@article{arxiv.2605.04539,
title = {RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization},
author = {Qiming Bao and Juho Leinonen and Paul Denny and Michael J. Witbrock},
journal= {arXiv preprint arXiv:2605.04539},
year = {2026}
}