中文

GenoMAS:基于代码驱动的基因表达分析科学发现多智能体框架

人工智能 2026-05-19 v3 机器学习 多智能体系统 基因组学

摘要

基因表达分析是许多医学发现的关键,但从原始转录组数据中提取见解仍然困难 due to 多个大型半结构化文件及需广泛专业知识的复杂性。当前的自动化方法往往受限于在边缘情况下会失效的僵化工作流程,或是缺乏严谥科学探究所需精度的完全自主智能体。GenoMAS 采用不同路径,提出由基于大语言模型的科学家组成的团队,将结构化工作流程的可靠性与自主智能体的适应性相结合。GenoMAS 通过类型消息传递协议编排六个专业化 LLM 智能体,每个智能体为共享分析画布贡献互补优势。在 GenoMAS 核心位于一种引导规划框架:编程智能体将高层任务指南展开为行动单元,并在每个节点决定前进、修订、跳过或回溯,从而在保持逻辑连贯性的同时,能灵活应对基因组数据的特殊性。在 GenoTEX 数据集上,GenoMAS 在数据预处理方面达到 89.13% 的复合相似相关性,在基因识别方面达到 60.48% 的 F1 分数,分别超过最佳先前技术方法提升了 10.61% 和 16.85%。除了指标外,GenoMAS 还揭示了与文献相符的生物学上合理的基因-表型关联,同时调整了潜在混杂因子。代码已公开于 https://github.com/Liu-Hy/GenoMAS。

关键词

引用

@article{arxiv.2507.21035,
  title  = {GenoMAS: A Multi-Agent Framework for Scientific Discovery via Code-Driven Gene Expression Analysis},
  author = {Haoyang Liu and Yijiang Li and Haohan Wang},
  journal= {arXiv preprint arXiv:2507.21035},
  year   = {2026}
}

备注

51 pages (14 pages for the main text, 10 pages for references, and 27 pages for the appendix)