DART-Eval:面向调控 DNA 的全方位 DNA 语言模型评估基准
机器学习
2026-03-25 v3 基因组学
摘要
近期自监督模型在自然语言、视觉和蛋白质序列方面的进展,启发了开发大型基因组 DNA 语言模型(DNALMs)。这些模型旨在学习多样化 DNA 元素的通用表征, potentially 启用 various genomic prediction, interpretation and design tasks。尽管具有巨大潜力,但现有基准不足以评估 DNALMs 在涉及调控基因活性的关键非编码 DNA 元素的下游应用中的能力。本研究引入 DART-Eval,一个专注于调控 DNA 的代表性基准套件,用于评估模型在零样本、探测和微调情景下的性能,同时以当代 ab initio 模型为基准。我们的基准针对生物学上有意义的下游任务,如功能序列特征发现、预测细胞类型特异性调控活性以及反事实预测基因变异影响。我们发现,当前 DNALMs 在大多数任务上表现不一,未能为替代基准模型带来显著提升,同时需要更多计算资源。我们讨论了下一代 DNALMs 可能的建模、数据 curated 和评估策略。我们的代码已公开于 https://github.com/kundajelab/DART-Eval。
引用
@article{arxiv.2412.05430,
title = {DART-Eval: A Comprehensive DNA Language Model Evaluation Benchmark on Regulatory DNA},
author = {Aman Patel and Arpita Singhal and Austin Wang and Anusri Pampari and Maya Kasowski and Anshul Kundaje},
journal= {arXiv preprint arXiv:2412.05430},
year = {2026}
}
备注
NeurIPS Datasets and Benchmarks 2024