BioMiner:用于从文献中自动挖掘蛋白-配体生物活性数据的多模态系统
人工智能
2026-04-24 v1 生物大分子
摘要
发表于文献中的蛋白-配体生物活性数据是药物发现中必不可少的,但手动标注难以跟上快速增长的文献数量。自动化生物活性提取具有挑战,因为它不仅要解释跨文本、表格和图形分布的生化语义,还要重建化学上精确的配体结构(如 Markush 结构)。为此,我们引入 BioMiner,一个多模态提取框架,显式地将生物活性语义解释与配体结构构建分离。在 BioMiner 中,生物活性语义通过直接推理推断,而化学结构则通过基于化学结构的视觉语义推理范式解决,其中多模态大语言模型在化学导向的视觉表示上运行,以推断 inter-structure 关系,具体的分子构建则交由领域化学工具完成。为进行严格的评估和方法开发,我们进一步建立 BioVista,一个来自 500 篇出版物中精选的、包含 16,457 条生物活性条目的综合基准。BioMiner 验证了其提取能力并提供了量化基准,实现生物活性三元组的 F1 分数达 0.32。BioMiner 的实际应用体现在三个方面:(1) 从 11,683 篇论文中提取 82,262 条数据构建预训练数据库,使下游模型性能提升 3.9%;(2) 实现人机协同工作流程,将高质量 NLRP3 生物活性数据的数量翻倍,帮助 28 个 QSAR 模型实现 38.6% 的改进,并识别出 16 个新 Scaffold 的活性候选物;(3) 加速蛋白-配体复合物生物活性标注,使速度提升 5.59 倍,准确率提高 5.75%,显著优于人工工作流程。
引用
@article{arxiv.2604.21508,
title = {BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature},
author = {Jiaxian Yan and Jintao Zhu and Yuhang Yang and Qi Liu and Kai Zhang and Zaixi Zhang and Xukai Liu and Boyan Zhang and Kaiyuan Gao and Jinchuan Xiao and Enhong Chen},
journal= {arXiv preprint arXiv:2604.21508},
year = {2026}
}
备注
20 pages, 5 figures, 1 table