温度与倾斜导致 SLOP:基于推理时对齐的奖励攻击缓解
机器学习
2026-05-14 v1 人工智能
计算与语言
摘要
推理时对齐技术作为轻量级替代或补充手段,能够在对齐目标和奖励目标不断演变的情况下实现持续适应。现有理论分析将这些方法证明为对给定奖励模型倾向度最高分布抽样的近似。我们通过引入参考模型温度调整,进一步扩展了推理时对齐的泛化能力,使其适用于由生成式奖励模型组合而成的 ensemble,组合方式为加固对数意见池(SLOP)。为缓解奖励攻击,我们提出了一种用于校准 SLOP 权重参数的算法,并实验演示其在保持对齐性能的同时提升鲁棒性。
引用
@article{arxiv.2605.13537,
title = {Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment},
author = {Ye Wang and Jing Liu and Toshiaki Koike-Akino},
journal= {arXiv preprint arXiv:2605.13537},
year = {2026}
}