中文

使人工智能与人类共享价值观对齐

计算机与社会 2023-02-20 v6 人工智能 计算与语言 机器学习

摘要

我们展示了如何评估语言模型对基本道德概念的知识。我们引入 ETHICS 数据集,这是一个涵盖正义、福祉、义务、美德和常识道德等概念的新基准。模型对关于多样文本情景的广泛道德判断进行预测。这需要将对物理与社会世界的知识连接到价值判断,这一能力可能使我们能够引导聊天机器人的输出,或最终正则化开放式的强化学习智能体。利用 ETHICS 数据集,我们发现当前语言模型具备预测基本人类伦理判断的可期却不完整的能力。我们的工作表明,当今在机器伦理上可以取得进展,并为与人类价值观对齐的 AI 提供了垫脚石。

关键词

引用

@article{arxiv.2008.02275,
  title  = {Aligning AI With Shared Human Values},
  author = {Dan Hendrycks and Collin Burns and Steven Basart and Andrew Critch and Jerry Li and Dawn Song and Jacob Steinhardt},
  journal= {arXiv preprint arXiv:2008.02275},
  year   = {2023}
}

备注

ICLR 2021; the ETHICS dataset is available at https://github.com/hendrycks/ethics/