中文

EXaMCaP:基于熵增最大化的子集选择,用于探测大型图表理解训练集的能力提升

机器学习 2026-02-05 v1

摘要

近期工作聚焦于合成图表理解(ChartU)训练集,以将更先进的图表知识注入多模态大语言模型(MLLMs),其中知识充分性通常通过微调后评估范式来量化能力提升。然而,全集微调 MLLMs 以评估此类能力提升会产生显著的时间成本,阻碍了对 ChartU 数据集进行的迭代细化。审视 ChartU 数据集的合成与数据选择领域,我们发现子集可能从全集微调中探测 MLLMs 的能力提升。鉴于数据多样性对于提升 MLLMs 性能至关重要,而熵反映了这一特征,我们提出 EXaMCaP,使用熵增最大化来选择子集。为了获得高多样性子集,EXaMCaP 从大型 ChartU 数据集中选择最大熵子集。由于枚举所有可能的子集是不可行的,EXaMCaP 迭代选择样本,以最大化相对于当前集合的集合熵增益,逼近整个数据集的最大熵子集。实验表明,EXaMCaP 在探测 ChartU 训练集能力提升方面优于基线方法,并在不同子集大小和各种 MLLM 架构之间表现出强大的有效性。

关键词

引用

@article{arxiv.2602.04365,
  title  = {EXaMCaP: Subset Selection with Entropy Gain Maximization for Probing Capability Gains of Large Chart Understanding Training Sets},
  author = {Jiapeng Liu and Liang Li and Bing Li and Peng Fu and Xiyan Gao and Chengyang Fang and Xiaoshuai Hao and Can Ma},
  journal= {arXiv preprint arXiv:2602.04365},
  year   = {2026}
}