中文

MidPO:基于混合专家框架的大语言模型安全性与有用性双重偏好优化

计算与语言 2025-06-04 v1

摘要

随着大语言模型(LLM)在各领域的应用日益广泛,在保持 LLM 有用性的同时提升其安全性已成为一项关键挑战。近期的研究通过安全约束的在线偏好优化或安全约束的离线偏好优化来解决这一问题。然而,安全约束的在线方法往往会导致过度安全,从而可能降低有用性;而安全约束的离线方法在自适应平衡安全性与有用性方面表现不佳。为了解决这些局限性,我们提出了 MidPO,一个用于安全性-有用性双重偏好优化的混合专家框架。首先,MidPO 设计了单偏好增强的直接偏好优化方法,将基础模型转化为两个独立的专家,分别称为安全性专家和有用性专家,并对这两个独立专家进行微调以实现最佳的安全性或有用性表现。其次,为了在安全性与有用性之间实现有效平衡,MidPO 将这两个专家整合到 MoE 框架中,并设计了动态路由机制以自适应地分配各专家的贡献。我们在三个流行数据集上进行了定量和定性实验,证明所提出的 MidPO 在安全性和有用性方面均显著优于 SOTA 方法。代码和模型将公开发布。

关键词

引用

@article{arxiv.2506.02460,
  title  = {MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework},
  author = {Yupeng Qi and Ziyu Lyu and Min Yang and Yanlin Wang and Lu Bai and Lixin Cui},
  journal= {arXiv preprint arXiv:2506.02460},
  year   = {2025}
}