SciCoQA: 面向科学论文与代码对齐的质量保证
计算与语言
2026-04-23 v3 人工智能
摘要
科学论文与其代码之间的差异会损害可复现性,随着自动化研究智能体将科学产出规模扩大到超越人类审查能力,这一担忧日益凸显。LLM 能否可靠地检测此类差异尚未得到系统性度量。为此,我们提出 SciCoQA,一个包含 635 个论文-代码差异(92 个真实,543 个合成)的数据集,用于此跨模态验证任务。在评估的 22 个模型中,即使是性能最佳的 LLM Gemini 3.1 Pro 和 GPT-5 Mini,也仅检测到 46.7% 的真实差异,揭示了自动化科学质量保证中的关键空白。我们从 GitHub issues 和可复现性论文构建 SciCoQA,并提出一条合成生成流水线,以将规模扩展至 AI 之外的物理学、定量生物学及其他计算科学。我们进一步引入差异类型与类别的分类法,以刻画所出现的不匹配。我们的分析表明,模型在处理遗漏的论文细节、长上下文输入以及预训练语料库之外的论文时尤为困难。
引用
@article{arxiv.2601.12910,
title = {SciCoQA: Quality Assurance for Scientific Paper--Code Alignment},
author = {Tim Baumgärtner and Iryna Gurevych},
journal= {arXiv preprint arXiv:2601.12910},
year = {2026}
}
备注
Accepted at ACL 2026