探究语言模型代理在存在干扰下操作化异质经验上下文的能力
计算与语言
2024-11-21 v1 人工智能
摘要
大型语言模型 (LLM) 代理在越来越多的领域展现出前景。在许多提议的应用中,期望代理对输入提示中呈现的累积经验进行推理。我们提出了 OEDD(Operationalize Experience Despite Distraction)语料库,这是一个由人类标注者验证的场景集合,包含预先编写好的代理历史记录,其中代理必须在存在干扰物的情况下根据异质经验信息做出决策。我们使用最小思维链提示策略评估了三个最先进的 LLM(GPT-3.5 Turbo、GPT-4o 和 Gemini 1.5 Pro),并观察到当 (1) 输入上下文包含超过 1,615 个 token 的历史交互,(2) 一个对决策至关重要的前提是对两个异质环境前提的正确结论,以及 (3) 随后出现一个微不足道但具有干扰性的红鲱鱼事实时,所有 LLM 在选择两个动作中较好一个时的表现都比随机选择更差。我们的代码和测试语料库公开于:https://github.com/sonnygeorge/OEDD 。
引用
@article{arxiv.2411.12828,
title = {Probing the Capacity of Language Model Agents to Operationalize Disparate Experiential Context Despite Distraction},
author = {Sonny George and Chris Sypherd and Dylan Cashman},
journal= {arXiv preprint arXiv:2411.12828},
year = {2024}
}