面向多模态数据集蒸馏的低秩相似性挖掘
机器学习
2024-06-07 v1 计算机视觉与模式识别
摘要
尽管数据集蒸馏近年来发展迅速,但多模态数据(如图像-文本对)的蒸馏面临着独特且尚未充分探索的挑战。与单模态数据不同,图像-文本对比学习(ITC)数据缺乏固有的分类,而应更加强调模态对应关系。在这项工作中,我们提出了用于多模态数据集蒸馏的低秩相似性挖掘(LoRS),该方法同时蒸馏包含图像-文本对的真实相似性矩阵,并利用低秩分解实现高效性和可扩展性。所提出的方法显著改进了现有算法,为视觉-语言数据集蒸馏领域做出了重要贡献。我们主张将LoRS作为图像-文本数据集蒸馏的基础合成数据设置。我们的代码可在 https://github.com/silicx/LoRS_Distill 获取。
引用
@article{arxiv.2406.03793,
title = {Low-Rank Similarity Mining for Multimodal Dataset Distillation},
author = {Yue Xu and Zhilin Lin and Yusong Qiu and Cewu Lu and Yong-Lu Li},
journal= {arXiv preprint arXiv:2406.03793},
year = {2024}
}
备注
Accepted at ICML 2024