中文

ValueDCG:衡量语言模型对人类价值的综合理解能力

计算与语言 2024-06-18 v4 人工智能 计算机与社会

摘要

个人价值观是人类决策背后的关键因素。鉴于大语言模型(LLMs)已被证明会显著影响人类决策,确保其准确理解人类价值以保障安全至关重要。然而,由于价值本身复杂且可变的特性,评估其对价值的理解颇为困难。我们认为,LLM 真正理解价值需要同时考虑“知道是什么”和“知道为什么”。为此,我们提出一种综合评估指标 ValueDCG(Value Discriminator-Critique Gap,价值判别-批判差距),通过工程实现定量评估这两个方面。我们评估了四个代表性 LLM,并提供有力证据表明,LLM 的“知道是什么”与“知道为什么”能力的增长率与参数数量的增加并不一致,导致随着参数量增大,模型理解人类价值的能力下降。这进一步可能表明,LLM 可能基于所提供的上下文编造看似合理的解释,却并未真正理解其内在价值,暗示了潜在风险。

关键词

引用

@article{arxiv.2310.00378,
  title  = {ValueDCG: Measuring Comprehensive Human Value Understanding Ability of Language Models},
  author = {Zhaowei Zhang and Fengshuo Bai and Jun Gao and Yaodong Yang},
  journal= {arXiv preprint arXiv:2310.00378},
  year   = {2024}
}