中文

面向 AI-for-Science 的低代码平台:贝叶斯对抗式多智能体框架

人工智能 2026-03-04 v1

摘要

大型语言模型(LLM)展示了用于自动化科学代码生成的潜力,但面临可靠性、多智能体工作流程中的错误传播以及在缺乏明确成功度量标准的领域中的评估挑战。我们提出一种专为 AI for Science(AI4S)任务设计的贝叶斯对抗式多智能体框架,形式为低代码平台(LCP)。在贝叶斯框架下协调三个 LLM 基于智能体:任务经理将用户输入结构化为可操作计划和自适应测试用例、代码生成器产生候选解决方案、评估器提供全面反馈。该框架采用对抗式循环,其中任务经理迭代细化测试用例以挑战代码生成器,同时通过贝叶斯原理动态更新提示分布,集成代码质量指标:功能正确性、结构对齐和静态分析。这种测试与代码的共优化减少了对 LLM 可靠性的依赖,解决了科学任务中固有的评估不确定性。LCP 还通过将非专家提示翻译为领域特定要求,简化了人机协作,绕过了缺乏编程背景的实践者手动进行提示工程的需求。基准评估表明,LCP 在生成稳健代码、最小化错误传播方面有效。该平台还在一个面向地球科学的跨学科任务上进行测试,显示出强大的可靠性,优于竞争模型。

关键词

引用

@article{arxiv.2603.03233,
  title  = {AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework},
  author = {Zihang Zeng and Jiaquan Zhang and Pengze Li and Yuan Qi and Xi Chen},
  journal= {arXiv preprint arXiv:2603.03233},
  year   = {2026}
}