通过链接论文和可执行代码中的生物信息学工具来支持工作流程可重复性
计算与语言
2026-03-10 v1
摘要
动机:生物学数据的快速增长加剧了对透明、可重复且文档完善的计算工作流程的需求。将工作流程代码中的步骤清晰地与论文中的描述相连接将 improve 工作流程理解, support 可重复性, and facilitate reuse。这一任务需要将生物信息学工具 in workflow code 与已发表工作流程描述中的提及进行链接。结果:我们提出了 CoPaLink,一种集成三个组件的自动方法:用于识别科学文本中工具提及的命名实体识别(NER),用于识别工作流程代码中工具提及的 NER,以及基于生物信息学知识库的实体链接。我们提出了所有三个步骤的方法,实现了 individual F1-measure 高达 84-89,联合准确率为 66,在使用 Bioconda 和 Bioweb 知识库对 Nextflow 工作流程进行评估时。CoPaLink 利用带有已策划工具注释的科学文章和工作流程可执行代码的语料库,以桥接叙述描述与工作流程实现之间的差距。可获得性:代码可在 https://gitlab.liris.cnrs.fr/sharefair/copalink-experiments 和 https://gitlab.liris.cnrs.fr/sharefair/copalink 上获得。语料库也可在 https://doi.org/10.5281/zenodo.18526700、https://doi.org/10.5281/zenodo.18526760 和 https://doi.org/10.5281/zenodo.18543814 上获得。
引用
@article{arxiv.2603.08195,
title = {Supporting Workflow Reproducibility by Linking Bioinformatics Tools across Papers and Executable Code},
author = {Clémence Sebe and Olivier Ferret and Aurélie Névéol and Mahdi Esmailoghli and Ulf Leser and Sarah Cohen-Boulakia},
journal= {arXiv preprint arXiv:2603.08195},
year = {2026}
}