论文是否完整呈现?面向生物信息学的隐藏实现差距基准与框架
机器学习
2026-05-01 v2 软件工程
摘要
确保研究论文与其对应软件代码实现之间的一致性,是保证科学发现可复现性和软件系统可靠性的基本前提。然而,迄今为止,该问题在生物信息学领域得到的关注有限,尤其是方法论描述与实际代码实现之间的不一致现象十分普遍。为此,我们引入了一种新颖的研究任务,即论文-代码一致性检测,旨在刻画论文中方法论描述与其对应代码实现之间的跨模态语义对齐。就数据而言,我们构建了该任务在生物信息学领域的第一个基准数据集,称为 BioCon,包含 48 个生物信息学软件项目及其关联出版物。BioCon 通过在论文中句子级方法论描述与代码函数级片段之间的细粒度对齐,结合专家标注和硬负采样策略,形成了高质量的句子-代码配对数据集。就方法论而言,我们提出了一种统一的跨模态一致性检测框架,利用预训练模型对论文句子和代码函数进行联合编码。我们从三个角度系统性地进行分析:句子级分类、跨模态检索和项目级一致性评估。实验结果表明,所提出的方法在一致性判别和语义对齐方面均取得优异性能。总体而言,本工作建立了论文-代码一致性分析的第一个系统性基准与框架,开启了一项新的研究方向,为提高生物信息学软件的可复现性和可靠性提供了基础。
引用
@article{arxiv.2603.22018,
title = {Do Papers Tell the Whole Story? A Benchmark and Framework for Uncovering Hidden Implementation Gaps in Bioinformatics},
author = {Tianxiang Xu and Xiaoyan Zhu and Xin Lai and Sizhe Dang and Xin Lian and Hangyu Cheng and Jiayin Wang},
journal= {arXiv preprint arXiv:2603.22018},
year = {2026}
}