FigEx2:面向科学复合图的视觉条件化面板检测与描述
计算机视觉与模式识别
2026-03-31 v4 人工智能
计算与语言
摘要
科学复合图将多个标记面板组合到单个图像中。然而,在对346,567个复合图的PMC规模爬虫中发现,16.3%没有标题,1.8%只有不到十词的标题,这导致现有标题分解管道会丢弃这些图像。我们提出FigEx2,一个视觉条件化框架,用于从图像中直接定位面板并生成面板级描述,将原本不可用的图像转换为与下游预训练和检索对齐的面板-文本对。为缓解开放式描述中的语言变异,我们引入一个噪声感知门控融合模块,适应性地控制描述特征如何条件化检测查询空间,并采用基于CLIP的对齐和基于BERTScore的语义奖励的分阶段SFT+RL策略。为支持高质量监督,我们策划了BioSci-Fig-Cap,一个针对面板级定位的精炼基准,以及来自物理和化学领域的跨学科测试套件。FigEx2在检测方面实现了0.728的[email protected]:0.95, 在METEOR上超过Qwen3-VL-8B 0.44分,在BERTScore上超过0.22分,并在无需微调的情况下实现零样本迁移到分布之外的科学领域。
引用
@article{arxiv.2601.08026,
title = {FigEx2: Visual-Conditioned Panel Detection and Captioning for Scientific Compound Figures},
author = {Jifeng Song and Arun Das and Pan Wang and Hui Ji and Kun Zhao and Yufei Huang},
journal= {arXiv preprint arXiv:2601.08026},
year = {2026}
}