统一科学交流:跨科学媒介的细粒度对应关系
计算机视觉与模式识别
2026-05-12 v2
摘要
科学知识的交流正变得越来越多模态化,涵盖文本、视觉和语音,形式包括研究论文、演示稿和录制演示等。这些不同表征共同传递一项研究的推理、结果与见解,提供互补的视角以丰富理解。然而,尽管分身相同目的,这些材料在结构化方式上往往彼此孤立,缺乏显式的关联,限制了统一的探索与分析。为填补这一空白,本文提出了多模态会议数据集 (MCD),首个将同一作品中的研究论文、演示视频、解释视频和演示稿整合为一体的基准数据集。我们评估了多种基于嵌入和视觉语言模型,以衡量其发现细粒度跨格式对应关系的能力,建立了该任务的首个系统基准。结果表明,视觉语言模型鲁棒性强但在细粒度对齐方面受限,而基于嵌入的模型在文本-视觉对应方面表现良好,但方程和符号内容在嵌入空间中形成独立聚类。这些发现既凸显了当前方法的优势,也揭示了局限,指向未来在多模态科学理解领域的关键研究方向。为保证可重复性,我们在 https://github.com/meghamariamkm2002/MCD 上发布了 MCD 资源。
引用
@article{arxiv.2605.05831,
title = {Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media},
author = {Megha Mariam K. M and Vineeth N. Balasubramanian and C. V. Jawahar},
journal= {arXiv preprint arXiv:2605.05831},
year = {2026}
}
备注
Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026