Square$\chi$PO:离线直接对齐中的差分隐私与鲁棒 $\chi^2$-偏好优化
机器学习
2025-05-28 v1
摘要
在本文中,我们在偏好标签损坏和隐私保护的双重条件下,从理论上研究了语言模型与人类偏好反馈的离线对齐。为此,我们提出了 SquarePO,对 PO 进行了简单的一行修改,将标准对数损失替换为基于概率的新平方损失。得益于这一新损失的内在属性,我们推进了差分隐私与鲁棒的离线直接对齐的最先进水平。具体而言,对于标签隐私的局部模型,SquarePO 是首个在具备广义函数逼近的情况下,基于单策略集中性实现最优速率的算法。它还给出了在提示词(响应)和标签上的中心化隐私保护模型下的首个结果。在针对 Huber 标签损坏的鲁棒性方面,SquarePO 是首个在广义函数逼近下具有有意义理论保证的对齐方法。更重要的是,SquarePO 可以同时处理隐私保护和标签损坏,其中观察到了一个有趣的分离现象,意味着隐私和损坏的先后顺序至关重要。此外,我们表明 SquarePO 也可以轻松扩展到处理广义偏好模型场景,并在损坏和隐私下提供最先进的保证。最后,我们所有的理论保证均享有统一的分析,建立在关于在损坏和隐私约束下最小二乘回归泛化误差界的新结果之上,我们认为该结果对学术界具有独立的意义。
引用
@article{arxiv.2505.21395,
title = {Square$\chi$PO: Differentially Private and Robust $\chi^2$-Preference Optimization in Offline Direct Alignment},
author = {Xingyu Zhou and Yulian Wu and Wenqian Weng and Francesco Orabona},
journal= {arXiv preprint arXiv:2505.21395},
year = {2025}
}