中文

GenoTEX:用于自动基因表达数据分析的 LLM 代理基准

机器学习 2025-04-09 v3 人工智能 基因组学

摘要

近期机器学习的进展显著提高了从基因表达数据集中识别疾病相关基因的能力。然而,这些过程通常需要大量专业知识和手动工作,限制了其可扩展性。大型语言模型 (LLM) 基于代理的方法因其日益增强的问题解决能力而显示出在自动化这些任务方面的潜力。为支持评估和发展此类方法,我们引入了 GenoTEX,用于自动分析基因表达数据的基准数据集。GenoTEX 提供解决广泛基因-特征关联问题的分析代码和结果,涵盖数据选择、预处理和统计分析,以遵循计算基因组学标准的管道。该基准包括来自生物信息学家的专家校准注释,以确保准确性和可靠性。为了为这些任务提供基线,我们present了 GenoAgent,一组采用多步骤编程工作流程并具备灵活自我纠正能力的 LLM 代理团队,用于协作分析基因表达数据集。我们的实验表明 LLM 方法在分析基因组数据方面具有潜力,而错误分析则突显了挑战和未来改进的领域。我们提出 GenoTEX 作为基准和增强自动化方法用于基因表达数据分析的有前景的资源。该基准可在 https://github.com/Liu-Hy/GenoTEX 查看。

关键词

引用

@article{arxiv.2406.15341,
  title  = {GenoTEX: An LLM Agent Benchmark for Automated Gene Expression Data Analysis},
  author = {Haoyang Liu and Shuyu Chen and Ye Zhang and Haohan Wang},
  journal= {arXiv preprint arXiv:2406.15341},
  year   = {2025}
}

备注

31 pages, 4 figures