PETA:评估子词分词下蛋白质迁移学习对下游应用的影响
计算与语言
2023-10-27 v1 人工智能
生物大分子
摘要
大型蛋白质语言模型善于捕获一级结构中的潜在进化信息,为蛋白质工程提供重要实用价值。相较于自然语言模型,蛋白质氨基酸序列数据量更小且组合空间有限。选择合适的词表大小以优化预训练模型是关键问题。此外,尽管自然语言社区有丰富的基准和研究成果,仍缺乏系统评估蛋白质语言模型质量的综合基准。鉴于这些挑战,PETA在三种分词方法下以14种不同词表大小训练语言模型,并在33个多样下游数据集上进行数千次测试以评估模型迁移学习能力,结合两种分类头和三个随机种子以减轻潜在偏差。大量实验表明,词表大小在50至200之间可优化模型,而超过800则会损害模型的表示性能。我们的代码、模型权重和数据集可在 https://github.com/ginnm/ProteinPretraining 获取。
引用
@article{arxiv.2310.17415,
title = {PETA: Evaluating the Impact of Protein Transfer Learning with Sub-word Tokenization on Downstream Applications},
author = {Yang Tan and Mingchen Li and Pan Tan and Ziyi Zhou and Huiqun Yu and Guisheng Fan and Liang Hong},
journal= {arXiv preprint arXiv:2310.17415},
year = {2023}
}
备注
46 pages, 4figures, 9 tables