In-Context学习会扭曲序列概率与生物学适应性之间的关系
机器学习
2025-04-25 v1 生物大分子
摘要
语言模型已成为预测生物序列可行性的强大工具。在训练期间,这些模型学习了遵循氨基酸或核苷酸序列语法规则。训练完成后,这些模型可以将序列作为输入并产生概率得分作为输出;更高的概率意味着遵循所学语法与实验适应性测量相关。我们展示In-Context学习会扭曲序列概率与适应性得分之间的关系。这一现象最显著地表现为包含重复 motifs 的序列具有异常高的概率得分。我们使用不同架构的蛋白语言模型训练于遮盖语言建模目标,并发现基于Transformer的模型对该效应最为敏感。这一行为由一种查找操作介导,该操作通过使用重复 motifs 的另一个副本作为参考来确定被遮盖位置的身份。这一检索行为可以覆盖模型所学习的先验。这一现象适用于不完美重复的序列,扩展到其他与生物学相关的特征,如RNA序列中反向互补 motifs,折叠成发夹结构。
引用
@article{arxiv.2504.17068,
title = {In-Context Learning can distort the relationship between sequence likelihoods and biological fitness},
author = {Pranav Kantroo and Günter P. Wagner and Benjamin B. Machta},
journal= {arXiv preprint arXiv:2504.17068},
year = {2025}
}