VISPA: 通过自动价值选择与激活实现多元对齐
计算与语言
2026-01-21 v1 人工智能
机器学习
摘要
随着大型语言模型越来越多地用于高风险领域,其输出必须反映的不是平均的人类偏好,而是各种不同的观点。然而,实现这种多元性仍然具有挑战性。现有方法考虑的价值有限,或依赖于提示层面的干预,缺乏价值控制和表示。为解决此问题,我们引入了VISPA,一个无需训练的多元对齐框架,通过动态选择和内部模型激活引导,实现对价值表达的直接控制。在涵盖多个模型和评估设置的广泛实证研究中,我们展示了VISPA在医疗保健及其他领域的多元对齐模式中均表现出色。进一步分析表明,VISPA可适应不同的引导初始化、模型和/或价值。这些结果表明,多元对齐可以通过内部激活机制实现,为服务于所有人的语言模型提供了一条可扩展的路径。
引用
@article{arxiv.2601.12758,
title = {VISPA: Pluralistic Alignment via Automatic Value Selection and Activation},
author = {Shenyan Zheng and Jiayou Zhong and Anudeex Shetty and Heng Ji and Preslav Nakov and Usman Naseem},
journal= {arXiv preprint arXiv:2601.12758},
year = {2026}
}
备注
WIP