SPA:通过自优先优化实现 LLM 对齐共识
计算与语言
2025-11-11 v1 计算机与社会
摘要
在自伤、法律或医疗等高风险场景中,LLM 必须既可信赖又有帮助。然而,这两个目标往往存在冲突。我们提出了优先级对齐范式,即严格执行“可信赖在于帮助之前”的排序:只有在首先满足可信赖阈值(如无害性或诚实性)后,帮助性优化才得以进行。为实现这一目标,我们引入自优先级对齐 (SPA)——一个完全无监督的框架,该框架生成多样化响应,自行对其进行评估并依据模型自身进行精炼,随后应用双准则去噪以消除不一致性并控制方差。通过上述过程,SPA 构建了有序的优先级配对,并使用不确定性加权对齐损失进行微调,以强调高置信度、高间隙决策。实验表明,在多个基准测试中,SPA 在不损害安全性的前提下提升了帮助性,优于强大基线,同时保持了通用能力。我们的结果表明,SPA 提供了一种可扩展且可解释的对齐策略,适用于关键 LLM 应用场景。
引用
@article{arxiv.2511.06222,
title = {SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization},
author = {Yue Huang and Xiangqi Wang and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2511.06222},
year = {2025}
}
备注
Accepted by AAAI 2026 (Oral)