通过20问游戏探查大语言模型的多轮规划能力
计算与语言
2024-02-22 v3 人工智能
人机交互
机器学习
摘要
大语言模型(LLMs)善于回答表述清晰的问题。然而,面对模糊查询时它们可能表现不稳定并产生错误输出。这凸显了开发能够提出澄清问题以有效消除歧义的智能体的需求。该能力需要跨多轮对话的复杂理解、状态追踪、推理与规划。但直接度量此能力颇具挑战。本文给出一个替代问题,用于评估 LLM 通过向裁判提出一系列查询来推断其自身未知、但裁判已知实体的能力。该实体推断游戏可作为探查语言模型对话推理与规划能力的评测框架。我们系统评估了多种 LLM,发现它们在此任务上的表现存在显著差异。我们发现 GPT-4 等强模型大幅优于人类玩家。我们进一步采用行为克隆(BC)检验较弱模型能否仅借助强模型的示范来模仿强模型并泛化至数据或领域。我们最后提出利用强化学习通过游戏对局增强 Vicuna 模型的推理与规划能力,带来显著性能提升。我们希望该问题能为如何在模糊环境下训练自主智能体更智能地行动提供见解。
引用
@article{arxiv.2310.01468,
title = {Probing the Multi-turn Planning Capabilities of LLMs via 20 Question Games},
author = {Yizhe Zhang and Jiarui Lu and Navdeep Jaitly},
journal= {arXiv preprint arXiv:2310.01468},
year = {2024}
}
备注
24 pages