Value FULCRA:将大语言模型映射到基本人类价值观的多维谱系
计算与语言
2023-11-21 v1 人工智能
摘要
大语言模型(LLMs)的快速发展使其价值对齐的负责任开发备受关注。然而,如何在此语境下定义价值仍是一个很大程度上未被探索的问题。现有工作主要遵循有用、诚实、无害原则,并将价值规定为 AI 社区中表述的风险准则(如公平性与隐私保护),存在清晰度、适应性与透明度欠佳的问题。受跨文化人文与社会科学中基本价值的启发,本文提出一种新颖的基本价值对齐范式,并引入由基本价值维度张成的价值空间。通过识别底层价值,所有 LLM 的行为均可映射至该空间,具备应对上述三重挑战的潜力。为推进未来研究,我们应用具代表性的 Schwartz 基本价值理论作为初始化示例,构建了 FULCRA——一个由 5k(LLM 输出,价值向量)对组成的数据集。我们对 FULCRA 的广泛分析揭示了基本价值与 LLM 行为间的底层关联,表明我们的方法不仅覆盖现有主流风险,还能预见可能未被识别的风险。此外,我们给出了基本价值评估与对齐的初步实现,为此方向的未来研究铺平道路。
引用
@article{arxiv.2311.10766,
title = {Value FULCRA: Mapping Large Language Models to the Multidimensional Spectrum of Basic Human Values},
author = {Jing Yao and Xiaoyuan Yi and Xiting Wang and Yifan Gong and Xing Xie},
journal= {arXiv preprint arXiv:2311.10766},
year = {2023}
}