中文

MULTIVERSE:暴露大型语言模型在多样世界中的对齐问题

计算与语言 2024-02-06 v1 机器学习

摘要

大型语言模型(LLM)对齐旨在确保LLM的输出符合人类价值观。研究人员已通过大范围的越狱技术演示了对齐问题的严重性,这些技术可以诱导LLM在对话中生成恶意内容。寻找相应的越狱提示通常需要 substantial的人类智力或计算资源。在本文中,我们报告LLM在不同情境下的对齐水平各异。因此,通过系统构建许多情境(称为世界),利用描述可能世界(例如时间、位置、角色、动作和语言)的领域特定语言和相应的编译器,我们可以以低成本暴露潜在的对齐问题。鉴于我们方法的低成本,我们能够进行大规模研究,关于LLM在不同世界中的对齐问题。我们的结果显示,我们的方法在有效性和效率方面均优于最新的越狱技术。此外,我们的结果表明,现有的LLM对嵌套世界和编程语言世界极其脆弱。这表明现有的对齐训练侧重于现实世界,缺乏对LLM可以被利用的各种(虚拟)世界的覆盖。

关键词

引用

@article{arxiv.2402.01706,
  title  = {MULTIVERSE: Exposing Large Language Model Alignment Problems in Diverse Worlds},
  author = {Xiaolong Jin and Zhuo Zhang and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2402.01706},
  year   = {2024}
}