用于跨模态视觉推理的测试时分布学习适配器
计算机视觉与模式识别
2024-03-12 v1
摘要
视觉-语言预训练(VLP)模型,如 CLIP,在学习通用视觉表示方面展现了卓越的有效性。若干方法旨在以有限的监督将 VLP 模型高效适配至下游任务,以期利用 VLP 模型中已获取的知识。然而,这些方法要么会引入有偏的表示,要么需要较高的计算复杂度,这阻碍了它们在微调 CLIP 模型时的有效性。此外,当模型在特定领域的数据上训练时,其泛化到未知领域的能力会下降。在本工作中,我们提出了测试时分布学习适配器,它直接在测试期间工作。具体而言,我们估计高斯分布以建模少样本支持图像的视觉特征,从而捕获来自支持集的知识。查询图像与支持图像特征分布之间的余弦相似度被用作视觉适配器的预测。随后,视觉适配器的预测通过残差连接与原始 CLIP 预测融合,得到最终预测。我们在人-物交互视觉推理上的广泛实验结果表明,我们提出的 TT-DNA 以大幅优势优于现有的 SOTA 方法。
引用
@article{arxiv.2403.06059,
title = {Test-time Distribution Learning Adapter for Cross-modal Visual Reasoning},
author = {Yi Zhang and Ce Zhang},
journal= {arXiv preprint arXiv:2403.06059},
year = {2024}
}
备注
Accepted by ICASSP 2024