中文

PICACO:通过总相关性优化实现 LLM 的多元化情境价值对齐

计算与语言 2026-05-28 v4 人工智能 计算机与社会

摘要

情境学习表明巨大语言模型 (LLM) 的潜力巨大,有助于在不进行高成本微调的情况下将其与人类价值观对齐,从而减少有害输出并容纳多样化偏好,称为情境对齐 (ICA)。然而,LLM 对输入提示的理解是不敏感的,这限制了 ICA 处理价值紧张关系的能力——人类价值观本质上是多元化的,常常会施加相互冲突的要求,例如刺激与传统。当前的 ICA 方法因此面临指令瓶颈挑战,其中 LLM 在单个提示中难以协调多个预期价值,导致对齐不完整或偏斜。为此,我们提出了 PICACO,一种新的多元化 ICA 方法。无需微调,PICACO 通过最大化指定价值与 LLM 响应之间的总相关性来优化一个包含多个价值的 meta 指令,从而更好地引导 LLM 理解这些价值并提高对齐。这理论上强化了价值一致性,减少了干扰性噪声, resulting in 更有效的指令。广泛的实验表明,PICACO 能与黑盒和开源 LLM 良好工作,超过几个最近的强基准,并在平衡最多 8 个不同价值方面取得更好效果。

关键词

引用

@article{arxiv.2507.16679,
  title  = {PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization},
  author = {Han Jiang and Dongyao Zhu and Xiaoyuan Yi and Ziang Xiao and Zhihua Wei and Xing Xie},
  journal= {arXiv preprint arXiv:2507.16679},
  year   = {2026}
}

备注

ICML 2026