ProSocialAlign:语言模型的偏好条件化测试时间对齐
计算与语言
2025-12-09 v1
摘要
当前的语言模型安全范例在情感紧张或高风险情境中往往不足,因为拒绝-仅方法可能使用户感到疏离,而 naïve 遵从则可能放大风险。我们提出 ProSocialAlign,一个测试时间、参数高效的框架,用于引导生成向安全、同理和价值对齐的响应,而无需重新训练基础模型。我们形式化了五个以人为中心的目标,将安全性作为 lexicographic 约束生成:首先应用硬约束消除有害连续性;然后在安全集合内优化 prosocial 质量。该方法结合了 (i) 方向性调节,这是一种减轻伤害机制,即在参数空间中减去学习的 "伤害向量";以及 (ii) 偏好感知自回归奖�模型,这在带有梯度冲突解决的跨属性联合训练中实现细粒度、用户可控制的解码。通过对五个安全基准的实证评估,演示了该方法的有效性,显示在多个评估指标上均实现了领先性能,显著减少了不安全泄漏并提升了对人类价值的对齐。ProSocialAlign 为在推断时间生成具有上下文敏感性、安全和人类对齐响应提供了稳健且模块化的基础。
引用
@article{arxiv.2512.06515,
title = {ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models},
author = {Somnath Banerjee and Sayan Layek and Sayantan Adak and Mykola Pechenizkiy and Animesh Mukherjee and Rima Hazra},
journal= {arXiv preprint arXiv:2512.06515},
year = {2025}
}