面向多模态信息抽取的选择性视觉证据:SAVER
计算机视觉与模式识别
2026-05-21 v1 人工智能
机器学习
摘要
社交媒体中的多模态信息抽取面临困难, 因为帖子可能附带多个图像, 这些图像与文本可能关系不大、冗余, 或甚至误导。 在这种情况下, 始终打开的多模态融合会浪费计算资源, 且可能放大虚假的视觉线索。核心挑战在于, 对每个候选 span 或标记实体对, 是否需要查询视觉信息, 以及如果需要, 应选择哪些小型子集图像提供可靠证据。我们提出 SAVER, 一个面向多模态命名实体识别和多模态关系抽取的选择性视觉即需框架。SAVER 使用 Conformal Groundability Gate (CGG) 来估计 MNER 中的 span 级别视觉地面可达性, 从而从两个标记实体派生 MRE 的 pair 级别激活, 并通过 Clopper--Pearson 上界的 conformal 风格程序校准激活阈值。当被激活时, 一个子模组相关性--多样性选择器从图像中选择一个紧凑的证据子集, 然后由 Set Transformer 聚合。一个能量灵感的联合评分头整合文本、可选视觉证据、文本--图像一致性以及稀疏路由用于实体类型或关系分类。实验表明, SAVER 在强大的文本-only 和始终打开的多模态基线之上 consistently 提升 F1, 同时降低 AURC, 在固定风险水平下提高激活覆盖率, 并降低 FLOPs 和 P90 latency。
引用
@article{arxiv.2605.20713,
title = {SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction},
author = {Miaobo Hu and Shuhao Hu and Bokun Wang and Rui Chen and Xin Wang and Xiaobo Guo and Daren Zha and Jun Xiao},
journal= {arXiv preprint arXiv:2605.20713},
year = {2026}
}