ReDAct:面向LLM代理的不确定性感知延迟决策
计算与语言
2026-04-09 v1 机器学习
多智能体系统
摘要
最近,基于LLM的代理在诸多应用中变得日益受欢迎,包括复杂的序列决策问题。然而,他们继承了LLM幻觉的倾向,导致错误决策。在序列环境中,一次错误决策可能不可逆地降低轨迹质量,使幻觉成为更大问题。虽然更大的LLM幻觉较少,但其每token成本显著更高。本文通过提出ReDAct(Reason-Defer-Act)来解决这一权衡。在ReDAct中,代理配备两个LLM:默认使用小型、低成本模型;当小型模型的预测不确定性超过校准阈值时,决策被延迟到大型模型。我们在基于文本的具身环境中进行评估,如ALFWorld和MiniGrid,表明仅需约15%的决策被延迟到大型模型,即可匹配其专属使用的质量,同时显著降低推理成本。
引用
@article{arxiv.2604.07036,
title = {ReDAct: Uncertainty-Aware Deferral for LLM Agents},
author = {Dzianis Piatrashyn and Nikita Kotelevskii and Kirill Grishchenkov and Nikita Glazkov and Ivan Nasonov and Ilya Makarov and Timothy Baldwin and Preslav Nakov and Roman Vashurin and Maxim Panov},
journal= {arXiv preprint arXiv:2604.07036},
year = {2026}
}