CORE:超越最终状态的 LLM 智能体全路径评估
人工智能
2025-09-26 v1
摘要
评估通过函数调用序列解决实际任务的 AI 智能体 remains 一个开放挑战。现有的智能体基准通常将评估简化为对最终状态的二元判断,忽略了安全性、效率和中间正确性等关键方面。我们提出一种基于确定性有限自动机 (DFA) 的框架,将任务编码为有效工具使用路径的集合,从而实现对智能体在不同世界模型中的行为进行原则性评估。建立在此基础上,我们引入 CORE,一套五个指标,包括路径正确性 (Path Correctness)、Kendall's tau 复合路径正确性 (Path Correctness - Kendall's tau Composite)、前缀关键性 (Prefix Criticality)、有害调用率 (Harmful-Call Rate) 和效率 (Efficiency),用于量化与预期执行模式的对齐程度。我们的方法在不同世界中揭示了在传统最终状态评估方案下看似等效的智能体之间的重要性能差异。
引用
@article{arxiv.2509.20998,
title = {CORE: Full-Path Evaluation of LLM Agents Beyond Final State},
author = {Panagiotis Michelakis and Yiannis Hadjiyiannis and Dimitrios Stamoulis},
journal= {arXiv preprint arXiv:2509.20998},
year = {2025}
}
备注
Accepted: LAW 2025 Workshop NeurIPS 2025