中文

道德必然要求:对大型语言模型进行持续超级对齐的必要性

计算机与社会 2024-03-25 v1 人工智能 计算与语言 机器学习

摘要

本文探讨了在AI系统,特别是大型语言模型(LLM)中实现终身超级对齐所面临的挑战。超级对齐是一个理论框架,旨在确保超级智能AI系统的行为符合人类的价值观和目标。尽管其愿景令人期待,但我们认为,由于LLM在理解和适应人类伦理的动态本质及不断演变的全球场景方面存在固有局限性,实现超级对齐需要对当前的LLM架构进行实质性改变。我们剖析了将不断变化的人类价值观谱系编码到LLM中的挑战,强调了静态AI模型与人类社会动态本质之间的差异。为了说明这些挑战,我们分析了两个不同的例子:一个展示了人类价值观的定性转变,而另一个则呈现了可量化的变化。通过这些例子,我们说明了受限于训练数据的LLM如何无法与当代人类价值观和场景保持对齐。本文最后探讨了应对并可能缓解这些对齐差异的潜在策略,为追求更具适应性和响应能力的AI系统指明了前进方向。

关键词

引用

@article{arxiv.2403.14683,
  title  = {A Moral Imperative: The Need for Continual Superalignment of Large Language Models},
  author = {Gokul Puthumanaillam and Manav Vora and Pranay Thangeda and Melkior Ornik},
  journal= {arXiv preprint arXiv:2403.14683},
  year   = {2024}
}