Stackelberg 自标注:面向数据高效 LLM 对齐的鲁棒方法
机器学习
2026-01-22 v3
摘要
将大型语言模型 (LLM) 与人类偏好对齐通常需要大量细致筛选的数据,这既昂贵又容易产生标注噪声。我们提出了 Stackelberg Game Preference Optimization (SGPO),一种鲁棒对齐框架,将对齐建模为政策 (leader) 与最坏情况偏好分布 (follower) 之间的两人 Stackelberg 游戏。proposed SGPO 在 -Wasserstein 球中保证 -有界后悔,提供对 (self-)标注噪声的形式化鲁棒性。我们以 Stackelberg Self-Annotated Preference Optimization (SSAPO) 实现了 SGPO,该方法使用最少的人类标注 "seed" 偏好,并迭代自标注新的提示。在每个迭代中,SSAPO 应用分布式鲁棒重新加权合成标注,确保噪声或偏见的自标签不会偏离训练。惊人地说,使用仅 2K 个 seed 偏好——约为标准人类标签的 1/30——SSAPO 在三个迭代后即可在多个基准测试中取得对 GPT-4 的强劲胜率。这一结果表明,以原则性的 Stackelberg 公式形式可为 LLM 提供数据高效对齐,显著减少对昂贵人工标注的依赖。
关键词
引用
@article{arxiv.2502.18099,
title = {Stackelberg Self-Annotation: A Robust Approach to Data-Efficient LLM Alignment},
author = {Xu Chu and Zhixin Zhang and Tianyu Jia and Yujie Jin},
journal= {arXiv preprint arXiv:2502.18099},
year = {2026}
}