中文

社会契约 AI:使 AI 助手与隐含群体规范对齐

计算与语言 2023-12-05 v2 人工智能

摘要

我们探讨通过从观测交互中反演用户(未知)偏好模型来对齐 AI 助手的思路。为验证该提议,我们在经济最后通牒博弈中进行概念验证模拟,将用户偏好形式化为指导模拟玩家行动的策略。我们发现,AI 助手能准确调整其行为以匹配经济学文献中的标准策略(如自私、利他)。然而,当面对未包含在助手训练分布中的货币(如克级药物)时,助手学到的策略缺乏鲁棒性,且在分布外设定下泛化能力有限。此外,我们发现当语言使用与未知策略之间的关系不一致时(如利他策略与粗鲁语言结合),助手对该策略的学习会变慢。总体而言,我们的初步结果表明,构建需要 AI 助手从多样化用户推断偏好的模拟框架,可为研究实际对齐问题提供有价值的方法。

关键词

引用

@article{arxiv.2310.17769,
  title  = {Social Contract AI: Aligning AI Assistants with Implicit Group Norms},
  author = {Jan-Philipp Fränken and Sam Kwok and Peixuan Ye and Kanishk Gandhi and Dilip Arumugam and Jared Moore and Alex Tamkin and Tobias Gerstenberg and Noah D. Goodman},
  journal= {arXiv preprint arXiv:2310.17769},
  year   = {2023}
}

备注

SoLaR NeurIPS 2023 Workshop (https://solar-neurips.github.io/)