中文

剖析大模型的伦理价值对齐

计算机与社会 2023-10-27 v1 人工智能 计算与语言

摘要

大模型极大提升了人工智能理解、生成和操纵信息与内容的能力,催生了众多应用。然而,随着这些模型日益融入日常生活,其固有的伦理价值和潜在偏见给社会带来了不可预见的风险。本文概述了与大模型相关的风险和挑战,调研了现有的AI伦理指南,并考察了由这些模型局限性引发的伦理问题。从规范伦理学的视角,我们提出对近期规范性指南的重新评估,强调学术界协作努力以建立统一且普适的AI伦理框架的重要性。此外,我们利用道德基础理论考察当前主流LLM的道德倾向,分析现有的对齐算法,并概述其中对齐伦理价值所遇到的独特挑战。为应对这些挑战,我们引入了一种用于对齐大模型伦理价值的新概念范式,并讨论了对齐标准、评估与方法中值得关注的研究方向,这代表了迈向跨学科构建伦理对齐AI的初步一步。本文为我们中文论文 https://crad.ict.ac.cn/cn/article/doi/10.7544/issn1000-1239.202330553 的修改英文版,旨在帮助非中文母语者更好地理解我们的工作。

关键词

引用

@article{arxiv.2310.17551,
  title  = {Unpacking the Ethical Value Alignment in Big Models},
  author = {Xiaoyuan Yi and Jing Yao and Xiting Wang and Xing Xie},
  journal= {arXiv preprint arXiv:2310.17551},
  year   = {2023}
}