中文

无训练双曲适配器用于更好的跨模态推理

计算机视觉与模式识别 2025-12-10 v1 人工智能

摘要

视觉-语言模型(VLMs)领域的近期研究显著提升了我们的跨模态推理能力。然而,现有方法在领域变化时会出现性能退化,或在新领域中需要大量计算资源进行微调。为了解决这一问题,我们开发了一种新的大型视觉-语言模型适配方法,称为无训练双曲适配器(T-DHA)。我们利用双曲空间而非传统的欧几里得空间来刻画语义概念之间的视觉-语言关系,后者通常具有层次化树结构。与欧几里得空间的多项式增长不同,双曲空间表现出随半径呈指数增长的体积。我们发现这一独特性质在使用 Poincaré 球模型嵌入层次化数据结构时特别有效,实现了显著提升的表示和判别能力。结合负学习,它能够以更少的特征维度实现更准确、更鲁棒的分类。我们在各种数据集上的广泛实验结果表明,T-DHA 方法在少样本图像识别和领域泛化任务中显著优于现有最先进方法。

关键词

引用

@article{arxiv.2512.08820,
  title  = {Training-Free Dual Hyperbolic Adapters for Better Cross-Modal Reasoning},
  author = {Yi Zhang and Chun-Wun Cheng and Junyi He and Ke Yu and Yushun Tang and Carola-Bibiane Schönlieb and Zhihai He and Angelica I. Aviles-Rivero},
  journal= {arXiv preprint arXiv:2512.08820},
  year   = {2025}
}

备注

Accepted in IEEE Transactions on Multimedia (TMM)