LLM代理的错位动作的预判检测与纠正
计算与语言
2025-10-01 v4 人工智能
摘要
在现实应用中部署基于LLM的代理人常面临一个关键挑战: 代理人的行为与用户意图之间的错位。这种错位可能导致代理人无意中执行携带负面后果的关键动作(例如在网上购物中意外触发"立即购买"),从而导致不可取甚至不可逆的后果。尽管解决这些问题至关重要,但对错位动作的预判检测和纠正仍相对未得到充分探索。为填补这一空白,我们引入InferAct,这是一种新方法,利用基于Theory-of-Mind的LLM代理人的信念推理能力,在执行前检测错位动作。一旦检测到错位,InferAct会警报用户以便及时纠正,防止不良后果并增强LLM代理人决策过程的可靠性。在三个广泛使用的数据集上进行的实验表明,InferAct在错位动作检测方面相对于基线方法可实现约20%的Marco-F1提升。对错位纠正的深入评估进一步凸显了InferAct在提高代理人对齐方面的有效性。
引用
@article{arxiv.2407.11843,
title = {Preemptive Detection and Correction of Misaligned Actions in LLM Agents},
author = {Haishuo Fang and Xiaodan Zhu and Iryna Gurevych},
journal= {arXiv preprint arXiv:2407.11843},
year = {2025}
}
备注
Accepted by EMNLP 2025