通过 GraphFLA 引入景观特征来增强生物适应性预测基准
机器学习
2025-10-30 v1
摘要
机器学习模型日益增多地将生物序列-适应性景观映射以预测突变效应。有效评估这些模型需要来自实验数据的基准数据集。尽管已有基准数据集规模宏大,但缺乏关于底层适应性景观的拓扑信息,这会阻碍对模型性能进行超越平均分数的解释和比较。本文引入 GraphFLA,一个能够从多模态突变数据(例如 DNA、RNA、蛋白质等)构建和分析适应性景观的 Python 框架,支持规模达数百万突变的数据。GraphFLA 计算20个生物学相关特征,以刻画景观拓扑的四个基本方面。通过将 GraphFLA 应用于 ProteinGym、RNAGym 和 CIS-BP 上的超过 5300 个景观,我们展示了其在解释和比较数十个适应性预测模型性能方面的实用性,突显影响模型准确性的因素以及不同模型各自的优势。此外,我们发布了 155 个组合完备的实验适应性景观,涵盖多种模态的超过 220 万个序列。所有代码和数据集均可在 https://github.com/COLA-Laboratory/GraphFLA 获取。
引用
@article{arxiv.2510.24826,
title = {Augmenting Biological Fitness Prediction Benchmarks with Landscapes Features from GraphFLA},
author = {Mingyu Huang and Shasha Zhou and Ke Li},
journal= {arXiv preprint arXiv:2510.24826},
year = {2025}
}
备注
56 apges, 18 figures, 8 tables, accepted as a conference paper at NeurIPS 2025