ConaCLIP:探索面向轻量级文本-图像检索的全连接知识交互图蒸馏
计算机视觉与模式识别
2023-05-30 v1 计算与语言
摘要
具有双编码器架构的大规模预训练文本-图像模型(如 CLIP)通常被用于包括文本-图像检索在内的多种视觉-语言应用。然而,由于大量的索引与推理时间以及巨大的计算资源消耗,这些模型在边缘设备或实时场景中仍不够实用。尽管知识蒸馏技术已广泛用于单模态模型压缩,但如何将其扩展至模态数量与教师/学生数量均加倍的情形则鲜有研究。本文中,我们针对该主题开展了全面实验,并提出用于跨模态预训练蒸馏的全连接知识交互图(Cona)技术。基于我们的发现,所得到的 ConaCLIP 在轻量级设定下于广泛使用的 Flickr30K 与 MSCOCO 基准上取得了 SOTA 性能。我们的方法在电商平台上的工业应用进一步证明了 ConaCLIP 的显著有效性。
引用
@article{arxiv.2305.17652,
title = {ConaCLIP: Exploring Distillation of Fully-Connected Knowledge Interaction Graph for Lightweight Text-Image Retrieval},
author = {Jiapeng Wang and Chengyu Wang and Xiaodan Wang and Jun Huang and Lianwen Jin},
journal= {arXiv preprint arXiv:2305.17652},
year = {2023}
}
备注
ACL 2023 Industry Track