SCAR:多模态数据集的特征描述方案
机器学习
2025-08-28 v1
摘要
基础模型在多样化任务上表现出显著的泛化能力,这在很大程度上由其训练数据的特性驱动。近年来的数据中心方法(如剪枝和压缩)旨在优化训练,但对数据特性如何影响泛化——尤其是样本缩放中的数据特性——提供的理论洞察有限。传统观点进一步通过主要关注数据量和训练效率来限制进展,往往忽视了数据质量的结构方面。在本研究中,我们引入了 SCAR,一种用于描述数据集内在结构特性的原则性方案,涵盖四个关键度量:规模(Scale)、覆盖度(Coverage)、真实性(Authenticity)和丰富度(Richness)。与先前的数据中心度量不同,SCAR 捕捉了在数据集缩放下保持不变稳定特性,为数据理解提供了稳健且通用的基础。利用这些结构特性,我们引入了 Foundation Data——一个在不需模型特定重新训练的情况下保留完整数据集泛化行为的最小子集。我们将单模态任务建模为阶跃函数,并估计基础数据大小的分布,以捕捉目标多模态数据集中跨模态的阶跃式泛化偏差。最后,我们基于此泛化偏差开发了一种 SCAR 引导的数据补全策略,实现了模态感知的高效扩展。实验涵盖了多样化的多模态数据集和模型架构,验证了 SCAR 在预测数据效用和指导数据获取方面的有效性。代码可在 https://github.com/McAloma/SCAR 获取。
引用
@article{arxiv.2508.19659,
title = {SCAR: A Characterization Scheme for Multi-Modal Dataset},
author = {Ri Su and Zhao Chen and Caleb Chen Cao and Nan Tang and Lei Chen},
journal= {arXiv preprint arXiv:2508.19659},
year = {2025}
}
备注
6 pages, 3 figures