SIN-Bench:在长上下文多模态科学交错文献中追踪原生证据链
计算与语言
2026-01-16 v1 人工智能
多媒体
摘要
评估多模态大语言模型是否真正理解长篇科学论文仍然具有挑战性:仅基于答案的指标和合成的“大海捞针”测试往往奖励答案匹配,而不要求在文档中进行因果的、证据链接的推理追踪。我们提出了“大海捞鱼”范式,该范式要求模型在原生科学文档中构建显式的跨模态证据链。为了实施 FITO,我们构建了 SIN-Data,这是一个保留了文本与图像原生交错方式的科学交错语料库。在此基础上,我们构建了 SIN-Bench,包含四个递进式任务,涵盖证据发现、假设验证、有依据的问答和证据锚定的综合。我们进一步引入了“无证据,无评分”机制,当预测基于可验证锚点时进行评分,并通过匹配度、相关性和逻辑性来诊断证据质量。在八个多模态大语言模型上的实验表明,证据锚定是主要瓶颈:Gemini-3-pro 取得了最佳平均总分(0.573),而 GPT-5 取得了最高的 SIN-QA 答案准确率(0.767),但在证据对齐的总分上表现不佳,暴露了正确性与可追踪支持之间的差距。
引用
@article{arxiv.2601.10108,
title = {SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature},
author = {Yiming Ren and Junjie Wang and Yuxin Meng and Yihang Shi and Zhiqiang Lin and Ruihang Chu and Yiran Xu and Ziming Li and Yunfei Zhao and Zihan Wang and Yu Qiao and Ruiming Tang and Minghao Liu and Yujiu Yang},
journal= {arXiv preprint arXiv:2601.10108},
year = {2026}
}