中文

linguistic 法则与蛋白质序列:关于子词分词方法的比较分析

计算与语言 2024-11-27 v1 定量方法

摘要

分词是处理蛋白质序列的关键步骤,因蛋白质是复杂的氨基酸序列,需要有意义的分段来捕获其功能和结构特性。然而,现有的子词分词方法主要为人类语言开发,可能不适用于具有独特模式和约束的蛋白质序列。本研究评估了三个主要的分词方法:字节配对编码 (BPE)、WordPiece 和 SentencePiece,在不同的词汇大小(400-6400)下,对其在蛋白质序列表征、域边界保持和遵循 established linguistic 法则方面的有效性进行分析。我们的全面分析揭示了这些分词器之间存在不同的行为模式,词汇大小显著影响其性能。BPE 在较小词汇大小下表现出更好的上下文专业化和略优的域边界保持,而 SentencePiece 实现更好的编码效率,导致较低的 fertility 分数。WordPiece 在这些特征之间提供了平衡的折中。然而,所有分词器在保持蛋白质域完整性方面都存在局限,特别是随着词汇大小的增加。对 linguistic 法则遵循性的分析显示,部分符合 Zipf 定律和简洁定律,但对 Menzerath 定律有显著偏差,这表明蛋白质序列可能遵循与自然语言不同的组织原则。这发现突显了将传统 NLP 分词方法应用于蛋白质序列的局限性,并强调需要开发更能考虑蛋白质独特性质的专门分词策略。

关键词

引用

@article{arxiv.2411.17669,
  title  = {Linguistic Laws Meet Protein Sequences: A Comparative Analysis of Subword Tokenization Methods},
  author = {Burak Suyunu and Enes Taylan and Arzucan Özgür},
  journal= {arXiv preprint arXiv:2411.17669},
  year   = {2024}
}

备注

8 pages, 9 figures