中文

LGCA:通过渐进式扩张增强语义表示

计算机视觉与模式识别 2025-11-04 v1 人工智能

摘要

近期大规模预训练在自然语言处理领域的进展,使预训练视觉语言模型如CLIP能够有效对齐图像和文本,显著提升零样例图像分类任务性能。后续研究进一步表明,对图像裁剪为小区域并使用大语言模型为每个caption生成多个描述可进一步提升模型性能。然而,由于CLIP 的固有敏感性,随机图像裁剪会引入误信息和偏差,因为许多图像在小尺度下共享相似特征。为解决此问题,我们提出Localized-Globalized Cross-Alignment(LGCA)框架,首先捕获图像的局部特征,然后反复选择最显著的区域并进行扩张。相似度得分设计为包含原始和扩张后图像,使模型能够捕捉局部和全局特征,同时最小化误信息。此外,我们提供理论分析表明,LGCA 在反复扩张过程之前的时间复杂性与原始模型相同,凸显其效率和可扩展性。大量实验表明,该方法在多样化数据集上显著提升了零样例性能,超越了最先进的基线方法。

关键词

引用

@article{arxiv.2511.00419,
  title  = {LGCA: Enhancing Semantic Representation via Progressive Expansion},
  author = {Thanh Hieu Cao and Trung Khang Tran and Gia Thinh Pham and Tuong Nghiem Diep and Thanh Binh Nguyen},
  journal= {arXiv preprint arXiv:2511.00419},
  year   = {2025}
}

备注

15 pages, 5 figures, to appear in SoICT 2025