中文

基于文本与图像增强的扩散增强测试时适应方法

计算机视觉与模式识别 2024-12-30 v2

摘要

现有的测试时提示调谐(TPT)方法聚焦于单模态数据,主要增强图像并利用置信度评分过滤不准确的图像。然而,虽然图像生成模型可产生视觉上多样化的图像,但单模态数据增强技术仍无法捕获来自不同模态所提供的综合知识。此外,我们注意到TPT-based方法在增强图像数量有限时性能会显著下降,这在生成式增强计算成本较高的情况下并非寻常。为此,我们引入IT3A,这是一种新颖的测试时适应方法,利用预训练生成模型对来自未知新领域的每个测试样本进行多模态增强。通过结合预训练视觉和语言模型的增强数据,我们提高了模型适应未知测试数据的能力。此外,为确保在生成各种视觉和文本增强时保留关键语义,我们采用原始测试数据中增强图像和文本logit的余弦相似度进行过滤,以此筛选部分虚假增强和不充分的组合。为充分利用生成模型在不同模态下提供的多样化增强,我们将提示调谋替换为适配器,以获得更大的灵活性。我们在具有分布迁移和领域间隙的测试数据集上进行实验,表明在零样本设置下,IT3A相对于最先进的测试时提示调谋方法在准确率上提升了5.50%。

关键词

引用

@article{arxiv.2412.09706,
  title  = {Diffusion-Enhanced Test-time Adaptation with Text and Image Augmentation},
  author = {Chun-Mei Feng and Yuanyang He and Jian Zou and Salman Khan and Huan Xiong and Zhen Li and Wangmeng Zuo and Rick Siow Mong Goh and Yong Liu},
  journal= {arXiv preprint arXiv:2412.09706},
  year   = {2024}
}

备注

Accepted by International Journal of Computer Vision