中文

在现实自主任务上评估语言模型智能体

计算与语言 2024-01-05 v2 人工智能 机器学习

摘要

在本报告中,我们探讨了语言模型智能体获取资源、自我复制以及适应其在实际环境中遇到的新挑战的能力。我们将这一能力集群称为“自主复制与适应”或 ARA。我们认为,具备 ARA 能力的系统可能会产生广泛且难以预见的后果,而测量和预测 ARA 可能有助于为安全、监控和对齐方面的措施提供信息。此外,一旦系统具备 ARA 能力,对系统能力设定界限可能会变得显著更加困难。我们构建了四个简单的示例智能体,将语言模型与允许其在世界中采取行动的工具相结合。然后,我们在与 ARA 相关的 12 项任务上评估了这些智能体。我们发现,这些语言模型智能体只能完成该列表中最简单的任务,尽管它们在更具挑战性的任务上取得了一些进展。遗憾的是,这些评估不足以排除近未来的智能体具备 ARA 能力的可能性。特别是,我们不认为这些评估能提供良好的保证,即“下一代”语言模型(例如在现有模型上实现 100 倍有效算力扩展)不会产生具备 ARA 能力的智能体,除非在预训练期间进行中间评估。与此相关的是,我们预计对现有模型进行微调可能会产生能力大幅增强的智能体,即使微调并非直接针对 ARA。

关键词

引用

@article{arxiv.2312.11671,
  title  = {Evaluating Language-Model Agents on Realistic Autonomous Tasks},
  author = {Megan Kinniment and Lucas Jun Koba Sato and Haoxing Du and Brian Goodrich and Max Hasin and Lawrence Chan and Luke Harold Miles and Tao R. Lin and Hjalmar Wijk and Joel Burget and Aaron Ho and Elizabeth Barnes and Paul Christiano},
  journal= {arXiv preprint arXiv:2312.11671},
  year   = {2024}
}

备注

14 pages