ReaLM: 反思增强的自主推理小型语言模型
分布式、并行与集群计算
2025-08-19 v1
摘要
小型语言模型(SLMs)是大型语言模型(LLMs)的成本有效替代方案,但因其有限的容量以及在多步骤推理期间产生错误或不一致答案的倾向,常在复杂推理方面表现不佳。现有方法通常以牺牲一个或多个关键方面为代价来提升 SLM 性能:(1)推理能力,由于有偏监督过滤掉负面推理路径并限制从错误中学习;(2)自主性,由于过度依赖外部生成的推理信号;以及(3)泛化,当模型过拟合到 teacher-specific 模式时会受到影响。本文引入 ReaLM,一个用于垂直领域中稳健且自足推理的强化学习框架。为提升推理能力,我们提出了 Multi-Route Process Verification(MRPV),对比正负推理路径以提取决定性模式。为减少对外部指导的依赖并提高自主性,我们引入 Enabling Autonomy via Asymptotic Induction(EAAI),一种逐渐淡化外部信号的训练策略。为提高泛化,我们应用引导链式思维蒸馏将领域特定规则和专家知识编码到 SLM 参数中,使其成为模型所学习内容的一部分。广泛的实验表明,ReaLM 在 (1)-(3) 方面显著提升了 SLM 性能。
引用
@article{arxiv.2508.12386,
title = {Breaking the Aggregation Bottleneck in Federated Recommendation: A Personalized Model Merging Approach},
author = {Jundong Chen and Honglei Zhang and Chunxu Zhang and Fangyuan Luo and Yidong Li},
journal= {arXiv preprint arXiv:2508.12386},
year = {2025}
}