语言学家能更好地理解 DNA 吗?
计算与语言
2025-01-20 v3 基因组学
摘要
多语言迁移能力反映了在一种源语言上微调的模型能够多大程度地应用于其他语言,这在多语言预训练模型中已得到充分研究。然而,这种能力在自然语言与基因序列/语言之间的迁移是否存在,仍处于探索不足的状态。本研究通过借鉴自然语言中用于评估句子相似度的句子对分类任务,来填补这一空白。我们构建了两个类似的任务:DNA 对分类(DNA 序列相似性)和 DNA-蛋白质对分类(基因编码判定)。这些任务旨在验证从自然语言到基因序列的能力可迁移性。即使是像 GPT-2-small 这样在英语上预训练的小规模模型,在英语句子对分类数据(XTREME PAWS-X)上微调后,在 DNA 对分类任务上也达到了 78% 的准确率。而在多语言文本上训练 BERT 模型时,准确率达到了 89%。然而,在更复杂的 DNA-蛋白质对分类任务上,模型的输出几乎与随机输出无异。实验验证已确认,从自然语言到生物语言的能力迁移是明确存在的。在此基础上,我们还研究了模型参数规模和预训练对这种能力迁移的影响。我们为促进从自然语言到遗传语言的能力迁移提供了建议,并提出了基于这种能力进行生物学研究的新方法。这项研究为探索自然语言与遗传语言之间的关系提供了一个有趣的新视角。
引用
@article{arxiv.2412.07678,
title = {Can linguists better understand DNA?},
author = {Wang Liang},
journal= {arXiv preprint arXiv:2412.07678},
year = {2025}
}
备注
20 pages,8 figures