中文

ImmunoLingo:基于语言学的抗体语言形式化

定量方法 2024-08-06 v2 机器学习

摘要

自然语言与生物序列之间明显的相似性,近期引发了将深度语言模型(LMs)应用于抗体及其他生物序列分析的热潮。然而,由于缺乏生物序列语言的严格语言学形式化——其应定义基本成分,如词汇(即语言的离散单元)和语法(即关联序列良构性、结构与意义的规则)——导致 LMs 的应用大体上领域无关,未考虑所研究生物序列的底层结构。相反,语言学形式化可建立语言学知情的、因而领域自适应的 LM 应用组件。它将有助于更好地理解自然语言与生物序列之间的异同如何影响 LMs 的质量,这对于设计具有可提取序列-功能关系规则的可解释模型至关重要,例如支撑抗体特异性预测问题的那些规则。破译抗体特异性规则对于加速理性及计算机辅助生物治疗药物设计至关重要。在此,我们将抗体语言的属性形式化,从而不仅为语言学工具在适应性免疫受体分析中的应用奠定基础,也为一般免疫受体特异性的系统性免疫语言学研究奠定基础。

关键词

引用

@article{arxiv.2209.12635,
  title  = {ImmunoLingo: Linguistics-based formalization of the antibody language},
  author = {Mai Ha Vu and Philippe A. Robert and Rahmad Akbar and Bartlomiej Swiatczak and Geir Kjetil Sandve and Dag Trygve Truslew Haug and Victor Greiff},
  journal= {arXiv preprint arXiv:2209.12635},
  year   = {2024}
}

备注

19 pages, 3 figures