熵、不一致性与基因组学中基础模型的局限性
机器学习
2026-04-07 v1 计算与语言
基因组学
摘要
基因组学中的基础模型与自然语言处理领域的对应模型相比表现参差不齐。然而,其有效性有限的原因仍不为人所知。在这项工作中,我们研究了熵作为限制此类模型从训练数据中学习并发展基础能力的基本因素的作用。我们在文本和DNA序列上训练模型集成,并分析其预测、静态嵌入和经验Fisher信息流。我们表明,从未见token预测的角度来看,基因组序列的高熵导致接近均匀的输出分布、模型间的不一致以及静态嵌入的不稳定,即使对于架构、训练和数据都匹配的模型也是如此。我们进一步证明,在DNA上训练的模型将Fisher信息集中在嵌入层,似乎未能利用token间关系。我们的结果表明,仅从序列进行自监督训练可能不适用于基因组数据,对当前训练基因组基础模型的方法论假设提出了质疑。
引用
@article{arxiv.2604.04287,
title = {Entropy, Disagreement, and the Limits of Foundation Models in Genomics},
author = {Maxime Rochkoulets and Lovro Vrček and Mile Šikić},
journal= {arXiv preprint arXiv:2604.04287},
year = {2026}
}