中文

嵌入几乎就够了:面向通用基因组预测任务的检索增强推理

量子物理 2025-08-15 v2

摘要

大型预训练 DNA 语言模型如 DNABERT-2、Nucleotide Transformer 和 HyenaDNA 在 various 基因组基准测试中表现出强大的性能。然而,大多数应用依赖高昂的微调,这在训练和测试数据分布相似时效果最佳。本文我们探讨了任务特定的微调是否总是必要的。我们展示,提取这些模型固定表示并输入轻量级分类器的简单嵌入方法可实现与微调相当的性能。在不同数据分布的评估设置下,嵌入方法往往在降低 10 倍到 20 倍推理时间的同时超越微调。我们的结果表明,嵌入提取不仅是强有力的基线,也是更通用且更高效的替代方案,尤其适用于部署在多样化或未见基因组上下文中。例如,在增子分类中,HyenaDNA 嵌入结合 zCurve 达到 0.68 的准确率(相对于微调的 0.58),推理时间减少 88%,碳排放降低超过 8 倍(0.02 kg 相对于 0.17 kg CO2)。在非 TATA 启动子分类中,DNABERT-2 嵌入结合 zCurve 或 GC 内容达到 0.85 的准确率(相对于微调的 0.89),碳足迹降低 22 倍(0.02 kg 相对于 0.44 kg CO2)。这些结果表明,嵌入管道在保持强大预测性能的同时,碳效率提升超过 10 倍。代码已提供:https://github.com/NIRJHOR-DATTA/EMBEDDING-IS-ALMOST-ALL-YOU-NEED。

关键词

引用

@article{arxiv.2508.04756,
  title  = {Comment on "Energy-speed relationship of quantum particles challenges Bohmian mechanics"},
  author = {Aurélien Drezet and Dustin Lazarovici and Bernard Michael Nabet},
  journal= {arXiv preprint arXiv:2508.04756},
  year   = {2025}
}

备注

Comment on DOI: 10.1038/s41586-025-09099-4. 5 pages, 1 figure. V2: Sign error corrected and minor edits