基于语言的自动注释增强框架提升分子与自然语言之间的翻译
机器学习
2025-02-11 v1 人工智能
生物大分子
摘要
近期的人工智能生物研究进展聚焦于整合分子数据与自然语言,以加速药物发现。然而,稀缺的高质量注释限制了该领域的进展。本文引入了 LA(Language-based Automatic Annotation Augmentation)框架,利用大型语言模型扩展现有数据集,从而改善AI训练。我们通过创建增强数据集 LaChEBI-20 来展示 LA的有效性,其中系统性地重写了来自已建立数据集的分子注释。这些重写后的注释保留了关键分子信息,同时提供了更丰富的句子结构和词汇。使用 LaChEBI-20,我们训练了基于基准架构的 LaMolT5,以学习分子表示与增强注释之间的映射。在基于文本的*de novo*分子生成和分子描述任务中,实验结果表明 LaMolT5 在状态-of-the-art模型方面表现更优。值得注意的是,纳入 LA可实现最高达301%的性能提升。此外,我们在*图像*、*文本*和*图*任务中验证了 LA的广泛应用前景,确认了其灵活性和实用性。
引用
@article{arxiv.2502.06634,
title = {Automatic Annotation Augmentation Boosts Translation between Molecules and Natural Language},
author = {Zhiqiang Zhong and Simon Sataa-Yu Larsen and Haoyu Guo and Tao Tang and Kuangyu Zhou and Davide Mottin},
journal= {arXiv preprint arXiv:2502.06634},
year = {2025}
}