中文

超越人类规范:通过跨学科方法揭示大语言模型的独特价值观

计算与语言 2024-05-13 v2 人工智能

摘要

大语言模型(LLM)的最新进展彻底改变了 AI 领域,但也带来了潜在的安全和伦理风险。解读 LLM 内嵌的价值观对于评估和缓解其风险至关重要。尽管对 LLM 的价值观进行了广泛调查,但以往的研究严重依赖社会科学中以人类为导向的价值体系。由此引出一个自然的问题:LLM 是否拥有超越人类的独特价值观?为深入探讨此问题,本工作提出了一个新颖的框架 ValueLex,利用人类人格/价值研究的心理学方法从零开始重构 LLM 的独特价值体系。基于词汇假设,ValueLex 引入了一种生成方法从 30 多个 LLM 中引出多样化的价值观,综合出一个分类体系,并通过因子分析和语义聚类最终形成全面的价值框架。我们识别出三个核心价值维度:能力、品格和正直,每个维度都有特定的子维度,这表明 LLM 拥有一个结构化但非人类的价值体系。基于该体系,我们进一步开发了定制的投射测验,以评估和分析不同模型规模、训练方法和数据来源下 LLM 的价值倾向。我们的框架促进了对 LLM 理解的跨学科范式,为未来的 AI 对齐和监管铺平了道路。

关键词

引用

@article{arxiv.2404.12744,
  title  = {Beyond Human Norms: Unveiling Unique Values of Large Language Models through Interdisciplinary Approaches},
  author = {Pablo Biedma and Xiaoyuan Yi and Linus Huang and Maosong Sun and Xing Xie},
  journal= {arXiv preprint arXiv:2404.12744},
  year   = {2024}
}

备注

16 pages, work in progress