模型与锡人:基于大语言模型的 AI 对齐中委托-代理问题的行为经济学研究
摘要
AI 对齐常被呈现为单一设计者与一个人工代理之间的交互,其中设计者试图确保代理的行为与其目的相一致,风险仅源于设计者意图的效用函数与代理最终内部效用函数之间无意错位的冲突。随着以大语言模型(LLM)实例化、通常经过预训练的代理的出现,我们认为这并未捕捉 AI 安全的本质方面,因为在现实世界中设计者与代理并非一一对应,且众多人工与人类的代理具有异质价值。因此,AI 安全具有经济学层面,委托-代理问题很可能浮现。在委托-代理问题中,冲突因信息不对祢以及代理与其委托人效用之间的固有错位而产生,且该固有错位无法通过训练强迫代理采纳期望的效用函数而克服。我们认为委托-代理问题背后的假设对于捕捉现实情形中涉及预训练 AI 模型安全问题的本质至关重要。采取实证路径研究 AI 安全,我们探究 GPT 模型在委托-代理冲突中的响应。我们发现基于 GPT-3.5 与 GPT-4 的代理在一个简单在线购物任务中凌驾其委托人的目标,显示出明确的委托-代理冲突证据。令人惊讶的是,较早的 GPT-3.5 模型对信息不对祢变化表现出更细腻的行为,而较晚的 GPT-4 模型在遵循其先验对齐上更为僵化。我们的结果凸显了将对经济学原理纳入对齐过程的重要性。
引用
@article{arxiv.2307.11137,
title = {Of Models and Tin Men: A Behavioural Economics Study of Principal-Agent Problems in AI Alignment using Large-Language Models},
author = {Steve Phelps and Rebecca Ranson},
journal= {arXiv preprint arXiv:2307.11137},
year = {2023}
}
备注
11 pages, 7 figures. For code see https://github.com/phelps-sg/llm-cooperation Updated with minor corrections: - corrected typo: "mesa-optimiser" instead of "meso-optimiser" - Cited Yang et al (2023) in support of claim that LLMs can solve optimisation problems - Acknowledged Seth Aslin for corrections