中文

AmCLR:用于跨模态表征的统一增强学习

机器学习 2024-12-12 v1 人工智能 计算机视觉与模式识别

摘要

对比学习已成为表征学习的关键框架,支撑了 SimCLR 和 CLIP 等单模态和双模态应用的进展。为解决大批量大小依赖和双模态性的根本限制,诸如 SogCLR 之类的方法利用随机优化实现全局对比目标。灵感来自 SogCLR 的效率和适应性,我们引入 AmCLR 和 xAmCLR 目标函数,针对双模态视觉-语言模型进一步增强对比学习的鲁棒性。AmCLR 集成多样化的增强措施,包括文本改写和图像变换,以强化对比表征的对齐,保持批量大小为几百个样本,而 Unlike CLIP 需要批量大小为 32,768 才能获得合理结果。xAmCLR 进一步通过整合原始模态与增强模态之间的内部模态对齐来实现更丰富的特征学习。这些进步导致更具韧性和可泛化性的对比学习过程,旨在克服规模化和增强多样性中的瓶颈。由于我们基于现有 SogCLR 框架构建,因此能够在更少的计算资源下实现更高的表征质量,为可扩展且稳健的多模态学习奠定了基础。

关键词

引用

@article{arxiv.2412.07979,
  title  = {AmCLR: Unified Augmented Learning for Cross-Modal Representations},
  author = {Ajay Jagannath and Aayush Upadhyay and Anant Mehta},
  journal= {arXiv preprint arXiv:2412.07979},
  year   = {2024}
}

备注

16 pages, 2 figures