中文

DiffCLIP:差分注意力与 CLIP 的结合

计算机视觉与模式识别 2025-03-11 v1 人工智能 机器学习

摘要

我们提出了 DiffCLIP,一种将差分注意力机制扩展到 CLIP 架构中的新颖视觉-语言模型。差分注意力最初是为大语言模型开发的,旨在放大相关上下文同时抵消噪声信息。在这项工作中,我们将该机制集成到 CLIP 的双编码器(图像和文本)框架中。仅需极少的额外参数,DiffCLIP 便在图像-文本理解任务中取得了卓越的性能。在零样本分类、检索和鲁棒性基准测试中,DiffCLIP 始终优于基线 CLIP 模型。值得注意的是,这些增益几乎不带来任何计算开销,这表明差分注意力可以在不牺牲效率的情况下显著增强多模态表示。代码可在 https://github.com/hammoudhasan/DiffCLIP 找到。

关键词

引用

@article{arxiv.2503.06626,
  title  = {DiffCLIP: Differential Attention Meets CLIP},
  author = {Hasan Abed Al Kader Hammoud and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2503.06626},
  year   = {2025}
}

备注

Under review