中文

LLM在概念上把握道德

计算与语言 2023-11-07 v1 计算机与社会

摘要

AI伦理与公平方面的研究在规范LLM以反映某些价值(如公平、真实与多样性)上已取得诸多进展。然而,它想当然地对待了LLM究竟如何可能“意指”任何事物这一问题。若不解决此问题,向LLM灌输此类价值的含义便不清晰。对此,我们提供了一个超越人类的意义通论,并用该理论阐明LLM作为意义主体的确切本质。我们提出,LLM凭借其作为意义主体的地位,已在概念上把握了人类社会建构(如道德、性别与种族)。因此,在某些伦理框架下,当前流行的模型对齐方法往好里说作用有限,往坏里说适得其反。此外,未对齐的模型或可帮助我们更好地发展自身的道德与社会哲学。

关键词

引用

@article{arxiv.2311.02294,
  title  = {LLMs grasp morality in concept},
  author = {Mark Pock and Andre Ye and Jared Moore},
  journal= {arXiv preprint arXiv:2311.02294},
  year   = {2023}
}

备注

Presented at NeurIPS 2023 Moral Pyschology and Moral Philosophy workshop