中文

VISPA: 通过自动价值选择与激活实现多元对齐

计算与语言 2026-01-21 v1 人工智能 机器学习

摘要

随着大型语言模型越来越多地用于高风险领域,其输出必须反映的不是平均的人类偏好,而是各种不同的观点。然而,实现这种多元性仍然具有挑战性。现有方法考虑的价值有限,或依赖于提示层面的干预,缺乏价值控制和表示。为解决此问题,我们引入了VISPA,一个无需训练的多元对齐框架,通过动态选择和内部模型激活引导,实现对价值表达的直接控制。在涵盖多个模型和评估设置的广泛实证研究中,我们展示了VISPA在医疗保健及其他领域的多元对齐模式中均表现出色。进一步分析表明,VISPA可适应不同的引导初始化、模型和/或价值。这些结果表明,多元对齐可以通过内部激活机制实现,为服务于所有人的语言模型提供了一条可扩展的路径。

关键词

引用

@article{arxiv.2601.12758,
  title  = {VISPA: Pluralistic Alignment via Automatic Value Selection and Activation},
  author = {Shenyan Zheng and Jiayou Zhong and Anudeex Shetty and Heng Ji and Preslav Nakov and Usman Naseem},
  journal= {arXiv preprint arXiv:2601.12758},
  year   = {2026}
}

备注

WIP