中文

ImagebindDC:基于Imagebind的数据多模态压缩

计算机视觉与模式识别 2025-11-12 v1 人工智能

摘要

数据压缩技术旨在从更大的数据集合成�凑数据集,以实现高效模型训练。然而,尽管在单模态场景中取得成功,但在多模态场景中往往难以保留关键的跨模态依赖。为此,我们提出ImagebindDC——一种基于Imagebind统一特征空间的数据压缩框架。我们的做法超越传统分布匹配,采用强大的特征函数(Characteristic Function, CF)损失,该损失在傅里叶域中运作,以通过精确的无限矩匹配实现更精确的统计对齐。我们设计目标函数以强制三层关键分布一致性:(i) 单模态对齐,通过匹配合成数据与真实数据在每个模态内的统计特性;(ii) 跨模态对齐,通过匹配混合真实-合成数据对的分布以保留两两语义;(iii) 联合模态对齐,通过对齐真实数据对及其合成对应物的联合分布以捕获完整的多变量数据结构。大量实验表明,ImagebindDC的有效性体现在:在NYU-v2数据集上,仅需每类5个压缩数据点即可实现无损性能,性能与完整数据集训练的模型相当,并实现了与前所未有的SOTA 8.2%绝对提升,压缩时间缩短了4倍以上。

关键词

引用

@article{arxiv.2511.08263,
  title  = {ImagebindDC: Compressing Multi-modal Data with Imagebind-based Condensation},
  author = {Yue Min and Shaobo Wang and Jiaze Li and Tianle Niu and Junxin Fan and Yongliang Miao and Lijin Yang and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2511.08263},
  year   = {2025}
}

备注

AAAI 2026, 18 pages, 6 figures, 6 tables