面向大语言模型的鲁棒在线对齐
机器学习
2026-02-25 v1 机器学习
摘要
我们研究了在偏离理想且未知真实标注 oracle 的情况下,对大型语言模型进行在线对齐的问题。由于数据收集与策略更新之间的耦合,大型语言模型的在线对齐问题是一个双层强化学习问题。最近,该问题在 SAIL(Self-Improving Efficient Online Alignment,自改进高效在线对齐)框架中被简化为可处理的单层目标。在本文中,我们在该问题中引入了点式 oracle 不确定性集合,并将鲁棒在线对齐目标 formulated 为最差情况优化问题。对于 log-linear 策略,我们证明了该鲁棒目标可严格分解为原始损失函数加上显式灵敏度惩罚项。我们开发了用于求解该弱凸目标的投射随机复合更新方法,并证明了达到近似 stationarity 所需的 oracle 复杂度为 。
关键词
引用
@article{arxiv.2602.20457,
title = {Oracle-Robust Online Alignment for Large Language Models},
author = {Zimeng Li and Mudit Gaur and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2602.20457},
year = {2026}
}