ChartREG++:面向多目标指涉与多样化指涉线索的图表指涉表达 grounding 基准
计算机视觉与模式识别
2026-05-11 v1 计算与语言
摘要
指涉表达 grounding 是视觉 grounding 中的核心问题,广泛用作视觉和语言模型空间 grounding 与推理的诊断工具,但大多数 prior work 聚焦于自然图像。相比之下,现有的图表指涉表达 grounding 相关基准仍受限:(1) 主要采用边界框,这限制了对细粒度图表元素的局部精度;(2) 大多数假设为单一或两个指涉目标实例,无法处理多实例目标引用;(3) 语言表达式过度依赖文本线索或数据排序线索;(4) 仅覆盖有限的图表类型。为此,我们引入一个图表指涉表达 grounding 基准,系统性地支持多种局部形式、多个指涉目标、多样化 grounding 线索和多样化图表类型。结果显示,在代表性多模态大模型上表现出显著的性能差距。我们进一步引入一个代码驱动的合成管道,利用绘图程序与渲染图表原始素材之间的内在对齐关系,推导出跨图表元素类型和粒度的像素级准确实例掩码。我们使用合成掩码训练一个实例分割模型,并将其集成到通用多模态 grounding 框架中。 resulting 系统在我们的基准上 consistently 超过基线方法,并在 ChartQA 派生的真实图表 grounding 基准上表现出良好的泛化能力。
关键词
引用
@article{arxiv.2605.07415,
title = {ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring},
author = {Tianhao Niu and Ziyu Han and Qingfu Zhu and Wanxiang Che},
journal= {arXiv preprint arXiv:2605.07415},
year = {2026}
}