VALUEFLOW:面向大语言模型多元化且可调节的值基准准齐
人工智能
2026-02-04 v1 计算与语言
摘要
与人类价值体系多样性相匹配的大语言模型(LLM)对齐仍是核心挑战:基于偏好的方法往往无法捕捉更深层的动机原则。价值基准方法提供了更原则化的路径,但仍存在三个不足:(i)提取过程常忽视层次化结构,(ii)评估仅能检测价值存在,无法衡量其校准强度,(iii)大语言模型在受控强度下的可调节性尚未得到充分理解。为此,我们引入VALUEFLOW——首个覆盖提取、评估与调控的统一框架,实现校准强度控制。该框架集成三大组件:(i)HIVES——捕捉价值体系内部及跨体系结构的层次化价值嵌入空间;(ii)Value Intensity DataBase(VIDB)——基于排序聚合方法构建的大规模价值标注文本数据库,包含强度估计;(iii)基于锚点的评估器,通过对模型输出在VIDB面板中的排序,生成一致的强度评分。运用VALUEFLOW,我们开展了横跨十个模型和四个价值理论的大规模研究,识别出多价值控制下的可调节性不对称性及组合规律。本文构建了可扩展的价值强度评估与控制基础设施,推动大语言模型的多元化对齐。
引用
@article{arxiv.2602.03160,
title = {VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models},
author = {Woojin Kim and Sieun Hyeon and Jusang Oh and Jaeyoung Do},
journal= {arXiv preprint arXiv:2602.03160},
year = {2026}
}