SP²DPO:一种由LLM辅助的语义化两两DPO泛化
计算与语言
2026-02-02 v1 人工智能
机器学习
摘要
直接偏好优化(DPO)使用单一全局温度beta控制拟合偏好标签与保持接近参考模型之间的权衡,隐式地将所有偏好对等同等信息。真实世界的偏好语料库是异构的:它们混合了高信号、客观失效(例如安全、事实性、指令违规)与低信号或主观差异(例如风格),并包括标签噪声。我们提出的方法为SP2DPO(语义化两两DPO),一种泛化方案,用来自结构化语义间隙注释(类别、幅度、置信度)由教师语言模型离线预决策的每个实例特定的beta_i取代全局温度。我们在UltraFeedback偏好语料库(59,960对)上实现了此程序,使大规模构建可审计的beta_i基质成为可能,且在训练时没有额外开销:内循环优化器仍为标准DPO,只是beta按对等设置。我们聚焦AlpacaEval 2.0进行经验研究,报告原始赢率和长度控制赢率。在四个开源权重、指令微调学生骨干网络(4B-8B)上,SP2DPO在两个四个骨干网络上提升了AlpacaEval 2.0长度控制赢率,表现与调谐全局beta DPO基线相当,同时避免了每个模型进行beta扫描。所有代码、注释和人工物料将公开发布。
引用
@article{arxiv.2601.22385,
title = {SP^2DPO: An LLM-assisted Semantic Per-Pair DPO Generalization},
author = {Chaoyue He and Xin Zhou and Di Wang and Hong Xu and Wei Liu and Chunyan Miao},
journal= {arXiv preprint arXiv:2601.22385},
year = {2026}
}
备注
39 pages, 15 figures, 16 tables, 60 equations