STRIDE:面向AI模态选择的系统框架——智能体AI、AI助手或LLM调用
摘要
从无状态大型语言模型(LLM)向自主、目标导向的智能体迈进,引发核心问题:何时才 truly necessary (真正必要) 的智能体AI?尽管智能体 enable (启用) 多步推理、持久记忆和工具编排,但盲目部署智能体会导致更高的成本、更复杂的系统以及更大的风险。我们提出STRIDE (Systematic Task Reasoning Intelligence Deployment Evaluator,系统化任务推理智能体部署评估器),一个提供原则性建议的框架,用于在三种模态之间进行选择:(i) 直接LLM调用、(ii) 引导AI助手、(iii) 完全自主的agentic AI。STRIDE整合了结构化任务分解、动态性归因和自省需求分析,以生成Agentic Suitability Score (智能体适用性分数),确保 full agentic autonomy (完全智能体自主性) 仅保留给具有内在动态性或不断演化背景的任务。我们在覆盖SRE、合规和企业自动化等30个真实世界任务上的评估显示,STRIDE在模态选择方面实现了92%的准确率,将不必要的智能体部署减少45%,并将资源成本降低37%。在SRE和合规领域的六个月专家验证确认了其实际效用,领域专家一致认为STRIDE有效区分了需要简单LLM调用、引导式助手或完全智能体自主性的任务。本工作重新定义了智能体采纳为 necessity-driven (必要性驱动) 的设计决策,确保自主性仅在其收益justify (正当) 成本时才被采纳。
引用
@article{arxiv.2512.02228,
title = {STRIDE: A Systematic Framework for Selecting AI Modalities -- Agentic AI, AI Assistants, or LLM Calls},
author = {Shubhi Asthana and Bing Zhang and Chad DeLuca and Ruchi Mahindru and Hima Patel},
journal= {arXiv preprint arXiv:2512.02228},
year = {2025}
}
备注
10 pages, 4 Figures, 5 Tables Paper presented at NeurIPS 2025 LAW workshop: Bridging Language, Agent, and World Models