TAI3:测试智能体理解用户意图的完整性
软件工程
2025-10-27 v3 人工智能
计算机与社会
摘要
LLM智能体越来越多地被部署用于通过自然语言指令调用API来自动化现实世界任务。尽管功能强大,但它们常常误解用户意图,导致智能体的行为偏离用户预期目标,尤其是在外部工具包不断演进的情况下。传统软件测试假设结构化输入,因此在处理自然语言的歧义性方面存在不足。我们引入了TAI3,一个以API为中心的压力测试框架,用于系统地发现LLM智能体中的意图完整性违规。与先前专注于固定基准或对抗性输入的工作不同,TAI3基于工具包文档生成现实任务,并应用定向变异来揭示细微的智能体错误,同时保留用户意图。为了指导测试,我们提出了语义划分,它根据工具包API参数及其等价类将自然语言任务组织成有意义的类别。在每个划分内,种子任务被变异,并由一个轻量级预测器进行排序,该预测器估计触发智能体错误的可能性。为了提高效率,TAI3维护了一个数据类型感知的策略记忆,用于检索和调整以往案例中有效的变异模式。在80个工具包API上的实验表明,TAI3有效地发现了意图完整性违规,在错误暴露率和查询效率方面均显著优于基线。此外,TAI3能很好地泛化到使用较小LLM生成测试的更强目标模型,并适应跨领域的不断演进的API。
引用
@article{arxiv.2506.07524,
title = {TAI3: Testing Agent Integrity in Interpreting User Intent},
author = {Shiwei Feng and Xiangzhe Xu and Xuan Chen and Kaiyuan Zhang and Syed Yusuf Ahmed and Zian Su and Mingwei Zheng and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2506.07524},
year = {2025}
}
备注
Accepted to NeurIPS 2025