大语言模型中高维人类价值表示
计算与语言
2025-03-27 v4 人工智能
摘要
LLM 在各种任务和领域的广泛应用要求这些模型与人类价值和偏好保持一致。鉴于人类价值对齐的各种方法,在这些 LLM 部署和采用之前,迫切需要了解注入其中的人类价值的范围和性质。我们提出了 UniVaR,一种 LLM 中符号化人类价值分布的高维神经表示,独立于模型架构和训练数据。这是一种连续且可扩展的表示,通过 8 个 LLM 的价值相关输出进行自监督学习,并在 15 个开源和商业 LLM 上进行了评估。通过 UniVaR,我们可视化并探索了 LLM 如何在 25 种语言和文化中优先考虑不同的价值,揭示了人类价值与语言建模之间复杂的相互作用。
引用
@article{arxiv.2404.07900,
title = {High-Dimension Human Value Representation in Large Language Models},
author = {Samuel Cahyawijaya and Delong Chen and Yejin Bang and Leila Khalatbari and Bryan Wilie and Ziwei Ji and Etsuko Ishii and Pascale Fung},
journal= {arXiv preprint arXiv:2404.07900},
year = {2025}
}