大型语言模型评估智能体对开放式请求响应中约束满足的能力
计算与语言
2024-09-24 v1
摘要
生成式 AI 智能体通常被期望能够响应那些没有唯一正确答案 (No One Right Answer, NORA) 的复杂用户请求,例如“设计一份低于 1800 卡路里的素食膳食计划”。此类请求可能包含一组智能体应当遵守的约束。为了成功开发适用于 NORA 场景的智能体,一个准确的自动评估框架是必不可少的,特别是能够验证智能体响应中约束满足情况的框架。近期,大型语言模型 (LLM) 已被用作许多 NORA 任务的多功能评估器,但它们评估生成文本中约束满足情况的能力仍不明确。为了研究这一问题,我们开发并发布了一个新颖的算术约束满足 (Arithmetic Constraint-Satisfaction, ACS) 基准测试数据集。该数据集包含复杂的用户请求及相应的约束、智能体响应,以及指示响应中每个约束满足程度的人类标签。该数据集的一个独特属性是,验证其许多约束需要将响应作为一个整体来审查(这与许多需要验证单个独立项的基准测试形成对比)。此外,它还评估了 LLM 在执行推理、上下文数据提取、算术计算和计数方面的能力。随后,我们在评估约束满足方面对开源和专有 LLM 进行了基准测试,结果表明大多数模型仍有显著的提升空间,且错误主要源于推理问题。此外,大多数模型表现出偏斜的约束满足预测模式,在真实标签为“满足”时准确率较高。最后,针对我们任务的少样本提示被证明相当具有挑战性,因为许多被研究的模型在引入该提示时表现出性能下降。
引用
@article{arxiv.2409.14371,
title = {The Ability of Large Language Models to Evaluate Constraint-satisfaction in Agent Responses to Open-ended Requests},
author = {Lior Madmoni and Amir Zait and Ilia Labzovsky and Danny Karmon},
journal= {arXiv preprint arXiv:2409.14371},
year = {2024}
}