中文

面向DNA序列和自然语言的酶功能多模态预测基准数据集

基因组学 2024-07-24 v1 机器学习

摘要

从DNA序列预测基因功能是生物学中的一个基本挑战。已提出许多深度学习模型来嵌入DNA序列并预测其酶功能,利用公共数据库中将DNA序列与酶功能标签关联的information。然而,生物学界对生物功能的大量知识并未体现在这些分类标签中,而是体现在对机制、反应和酶行为的非结构化文本描述中。这些描述通常与DNA序列一起存储在生物数据库中,尽管以非结构化的方式呈现。深度学习模型预测酶功能很可能从整合这种多模态数据编码的生物功能知识中受益。然而,目前尚无数据集专为机器学习算法利用这种多模态信息而设计。本文提出了一种新型数据集和基准套件,使可探索和开发大型多模态神经网络模型应用于基因DNA序列和自然语言描述的基因功能。我们在监督和无监督任务上都 presenting baseline performance,表明了这种建模目标的难度,同时展示了在功能预测中整合多模态数据相对于仅使用DNA序列的潜在优势。我们的数据集可在:https://hoarfrost-lab.github.io/BioTalk/访问。

关键词

引用

@article{arxiv.2407.15888,
  title  = {A Benchmark Dataset for Multimodal Prediction of Enzymatic Function Coupling DNA Sequences and Natural Language},
  author = {Yuchen Zhang and Ratish Kumar Chandrakant Jha and Soumya Bharadwaj and Vatsal Sanjaykumar Thakkar and Adrienne Hoarfrost and Jin Sun},
  journal= {arXiv preprint arXiv:2407.15888},
  year   = {2024}
}