中文

SoFA:基于优先级规则遵循的屏蔽式在线对齐

计算与语言 2024-02-28 v1

摘要

大语言模型 (LLMs) 中的对齐问题涉及使其适应广泛的人类价值观。由于偏好和监管标准的多样性,这一需求对现有的对齐方法构成了挑战。本文介绍了一种新的对齐范式——优先级规则遵循,该范式将规则定义为每次对话中的主要控制机制,并使其优先于用户指令。我们的初步分析显示,即使是 GPT-4 等先进的 LLMs,在理解和优先处理规则方面也表现出不足。因此,我们提出了 PriorityDistill,这是一种半自动化方法,旨在从 LLM 模拟中提取优先级遵循信号,以确保规则的稳健整合与遵守。我们的实验表明,该方法不仅利用一条通用规则有效最小化了不对齐现象,还能平滑适应各种未见规则,确保它们免受劫持,并使模型做出适当响应。

关键词

引用

@article{arxiv.2402.17358,
  title  = {SoFA: Shielded On-the-fly Alignment via Priority Rule Following},
  author = {Xinyu Lu and Bowen Yu and Yaojie Lu and Hongyu Lin and Haiyang Yu and Le Sun and Xianpei Han and Yongbin Li},
  journal= {arXiv preprint arXiv:2402.17358},
  year   = {2024}
}