中文

资源约束下通过基于间隔的目标函数修改增强小型 LLM 的对齐能力

计算与语言 2025-08-13 v1

摘要

小型大语言模型(LLM)在将输出与人类偏好对齐时常常面临困难,尤其是在性能差距严重的情况下。在这项工作中,我们提出了两种轻量级的基于 DPO 的变体——自适应间隔-Sigmoid 损失和 APO-hinge-zero——通过引入基于间隔的目标函数和选择性更新机制,以更好地应对性能不佳的场景。我们的 APO-hinge-zero 方法结合了基于合页的难例挖掘与 APO-zero 的偏好聚焦优化,取得了显著成果。在 AlpacaEval 中,与 APO-zero 基线相比,APO-hinge-zero 将胜率提高了 +2.0 个百分点,长度控制胜率提高了 +1.4 个百分点。在 MT-Bench 中,我们的方法在多个类别中保持了有竞争力的性能,尤其在 STEM 和人文学科任务中表现突出。这些结果表明,对基于偏好的目标函数进行简单修改,可以在资源约束下显著增强小规模 LLM 的对齐能力,为更高效的部署提供了一条实用路径。

关键词

引用

@article{arxiv.2508.08466,
  title  = {Enhancing Small LLM Alignment through Margin-Based Objective Modifications under Resource Constraints},
  author = {Daren Yao and Jinsong Yuan and Ruike Chen},
  journal= {arXiv preprint arXiv:2508.08466},
  year   = {2025}
}

备注

10 pages, 3 figures