ValueDCG:衡量语言模型对人类价值的综合理解能力
计算与语言
2024-06-18 v4 人工智能
计算机与社会
摘要
个人价值观是人类决策背后的关键因素。鉴于大语言模型(LLMs)已被证明会显著影响人类决策,确保其准确理解人类价值以保障安全至关重要。然而,由于价值本身复杂且可变的特性,评估其对价值的理解颇为困难。我们认为,LLM 真正理解价值需要同时考虑“知道是什么”和“知道为什么”。为此,我们提出一种综合评估指标 ValueDCG(Value Discriminator-Critique Gap,价值判别-批判差距),通过工程实现定量评估这两个方面。我们评估了四个代表性 LLM,并提供有力证据表明,LLM 的“知道是什么”与“知道为什么”能力的增长率与参数数量的增加并不一致,导致随着参数量增大,模型理解人类价值的能力下降。这进一步可能表明,LLM 可能基于所提供的上下文编造看似合理的解释,却并未真正理解其内在价值,暗示了潜在风险。
引用
@article{arxiv.2310.00378,
title = {ValueDCG: Measuring Comprehensive Human Value Understanding Ability of Language Models},
author = {Zhaowei Zhang and Fengshuo Bai and Jun Gao and Yaodong Yang},
journal= {arXiv preprint arXiv:2310.00378},
year = {2024}
}