中文

少样本可控对齐:用神经过程适配奖励与 LLM 策略

机器学习 2024-12-19 v1 人工智能

摘要

随着大语言模型(LLM)日益嵌入日常应用,确保其与个体用户的多样化偏好对齐已成为一项关键挑战。当前部署的方法通常假设用户目标同质,并依赖单目标微调。然而,人类偏好本质上是异质的,受各种不可观测因素影响,导致偏好数据中出现冲突信号。应对这种多样性的现有解决方案通常需要为特定目标标注的昂贵数据集,并涉及训练多个奖励模型或 LLM 策略,这在计算上代价高昂且不切实际。在本工作中,我们提出了一种少样本可控对齐的新框架,从用户少量选择样本中推断其潜在偏好。为此,我们将 Bradley-Terry-Luce 模型扩展以处理具有不可观测变异因素的异质偏好,并提出了其在奖励建模和 LLM 微调中的实用实现。得益于我们提出的函数参数空间条件化方法,用该框架训练的 LLM 可在推理时适配个体偏好,在连续的行为模式上生成输出。我们实证验证了该方法的有效性,证明了其能以数据高效的方式捕获并对齐多样化的人类偏好。我们的代码发布于:https://github.com/kasia-kobalczyk/few-shot-steerable-alignment。

关键词

引用

@article{arxiv.2412.13998,
  title  = {Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes},
  author = {Katarzyna Kobalczyk and Claudio Fanconi and Hao Sun and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2412.13998},
  year   = {2024}
}