中文

基于语言的自动注释增强框架提升分子与自然语言之间的翻译

机器学习 2025-02-11 v1 人工智能 生物大分子

摘要

近期的人工智能生物研究进展聚焦于整合分子数据与自然语言,以加速药物发现。然而,稀缺的高质量注释限制了该领域的进展。本文引入了 LA3^3(Language-based Automatic Annotation Augmentation)框架,利用大型语言模型扩展现有数据集,从而改善AI训练。我们通过创建增强数据集 LaChEBI-20 来展示 LA3^3的有效性,其中系统性地重写了来自已建立数据集的分子注释。这些重写后的注释保留了关键分子信息,同时提供了更丰富的句子结构和词汇。使用 LaChEBI-20,我们训练了基于基准架构的 LaMolT5,以学习分子表示与增强注释之间的映射。在基于文本的*de novo*分子生成和分子描述任务中,实验结果表明 LaMolT5 在状态-of-the-art模型方面表现更优。值得注意的是,纳入 LA3^3可实现最高达301%的性能提升。此外,我们在*图像*、*文本*和*图*任务中验证了 LA3^3的广泛应用前景,确认了其灵活性和实用性。

关键词

引用

@article{arxiv.2502.06634,
  title  = {Automatic Annotation Augmentation Boosts Translation between Molecules and Natural Language},
  author = {Zhiqiang Zhong and Simon Sataa-Yu Larsen and Haoyu Guo and Tao Tang and Kuangyu Zhou and Davide Mottin},
  journal= {arXiv preprint arXiv:2502.06634},
  year   = {2025}
}