中文

面向多模态数据集蒸馏的低秩相似性挖掘

机器学习 2024-06-07 v1 计算机视觉与模式识别

摘要

尽管数据集蒸馏近年来发展迅速,但多模态数据(如图像-文本对)的蒸馏面临着独特且尚未充分探索的挑战。与单模态数据不同,图像-文本对比学习(ITC)数据缺乏固有的分类,而应更加强调模态对应关系。在这项工作中,我们提出了用于多模态数据集蒸馏的低秩相似性挖掘(LoRS),该方法同时蒸馏包含图像-文本对的真实相似性矩阵,并利用低秩分解实现高效性和可扩展性。所提出的方法显著改进了现有算法,为视觉-语言数据集蒸馏领域做出了重要贡献。我们主张将LoRS作为图像-文本数据集蒸馏的基础合成数据设置。我们的代码可在 https://github.com/silicx/LoRS_Distill 获取。

关键词

引用

@article{arxiv.2406.03793,
  title  = {Low-Rank Similarity Mining for Multimodal Dataset Distillation},
  author = {Yue Xu and Zhilin Lin and Yusong Qiu and Cewu Lu and Yong-Lu Li},
  journal= {arXiv preprint arXiv:2406.03793},
  year   = {2024}
}

备注

Accepted at ICML 2024