自由交谈,严格执行:基于模式屏障的智能体 AI 用于灵活可复现的科学工作流程
人工智能
2026-03-09 v1 机器学习
多智能体系统
摘要
大型语言模型(LLM)现在可以将研究人员的纯文本目标翻译为可执行计算,但科学工作流程需要确定性、可追溯性和治理,这些在 LLM 决定运行内容时很难保证。对 18 位专家和 10 个工业 R&D 利益相关者进行半结构化访谈,揭示了 2 项相互竞争的要求——确定性受限执行和不带工作流程僵化性的对话灵活性——以及必须满足的边界属性(人类在回路中的控制和透明度)。我们提出模式屏障编排作为解决原则:模式成为组成工作流级别的强制执行边界,以便除非完整动作(包括跨步骤依赖)验证通过机器可检查的规范,否则不会运行。我们将 2 项要求 operationalized 为执行确定性(ED)和对话灵活性(CF),并沿着验证范围谱系评估 20 个系统,涵盖 5 个架构组。通过多模型协议——15 个独立会话跨 3 个 LLM 族——分配分数,获得 substantial-to-near-perfect inter-model agreement(ED 的 Krippendorff a=0.80,CF 的 a=0.98),表明多模型 LLM 评分可作为可复用的替代方案来评估架构。 resulting landscape 揭示了 empirical Pareto 前沿——未经审查的系统在灵活性和确定性之间未实现同时高水平——但在生成和工作流中心极端之间出现了一个收敛区。我们认为,模式屏障架构、分离对话和执行权威,正好 positioned to 解除 this trade-off,并提炼 3 项 operational 原则——执行前澄清、受限计划-行动编排、工具到工作流级别的屏障——指导采用。
引用
@article{arxiv.2603.06394,
title = {Talk Freely, Execute Strictly: Schema-Gated Agentic AI for Flexible and Reproducible Scientific Workflows},
author = {Joel Strickland and Arjun Vijeta and Chris Moores and Oliwia Bodek and Bogdan Nenchev and Thomas Whitehead and Charles Phillips and Karl Tassenberg and Gareth Conduit and Ben Pellegrini},
journal= {arXiv preprint arXiv:2603.06394},
year = {2026}
}