中文

具有内化效用判断的理性决策智能体

计算与语言 2025-06-10 v3

摘要

大语言模型(LLMs)已取得显著进展,并引发了大量将 LLM 发展为能够执行复杂多步决策任务(超越传统 NLP 应用)的智能体的研究努力。现有基于 LLM 的决策的多数方法主要依赖人工设计的外部性能指标来引导决策过程。然而,在真实场景中,将外部性能指标作为先验并不可靠,此类先验可能不可用、有缺陷甚至错误。对于真正的自主决策,智能体必须从其后验经验中发展出理性以独立判断决策。理性发展的核心在于构建一种内化的效用判断,能够为每一步决策赋予数值效用。本文提出 RadAgent(理性决策智能体),通过包含经验探索与效用学习的迭代框架来促进其理性的发展。在该框架内,设计了基于 Elo 的效用构建方法,通过对决策步骤的两两比较为其分配 Elo 分数以判断其效用。这些 Elo 分数进而引导决策过程以得出最优结果。在 ToolBench 数据集上的实验结果表明,RadAgent 优于基线方法,在多样任务上的通过率(Pass Rate)提升超过 10%。它提供了更高质量的解决方案并降低了成本(ChatGPT API 调用),凸显了其有效性与高效性。

关键词

引用

@article{arxiv.2308.12519,
  title  = {Rational Decision-Making Agent with Internalized Utility Judgment},
  author = {Yining Ye and Xin Cong and Shizuo Tian and Yujia Qin and Chong Liu and Yankai Lin and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2308.12519},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025