通过推理时注意力工程消除图像聚类中的伪影
计算机视觉与模式识别
2024-10-08 v1 机器学习
摘要
本文旨在改进不需重新训练或微调的预训练Vision Transformer(ViT)模型(特别是DINOv2)在图像聚类任务中的性能。随着模型规模的增加,多头注意力的 patch 中会出现高规范性伪影异常。我们观察到,这种异常会导致零样本图像聚类准确率下降。这些伪影表现为注意力图中某些 patch 令牌的值显著大于其他令牌。为解决这些伪影,我们提出一种称为推理时注意力工程(ITAE)的方法,该方法在推理期间操控注意力函数。具体而言,我们通过检验多头注意力中的一个 Query-Key-Value(QKV)patch 来识别伪影,并衰减其对应的注意力值。ITAE 在多个数据集上显示出更好的聚类准确率,表明其在潜在空间中更具表现力。我们的发现凸显了ITAE 作为一种无需重新训练或微调即可降低预训练ViT模型中伪影并提高聚类任务中模型性能的实用解决方案的潜力。
引用
@article{arxiv.2410.04801,
title = {Improving Image Clustering with Artifacts Attenuation via Inference-Time Attention Engineering},
author = {Kazumoto Nakamura and Yuji Nozawa and Yu-Chieh Lin and Kengo Nakata and Youyang Ng},
journal= {arXiv preprint arXiv:2410.04801},
year = {2024}
}
备注
Accepted to ACCV 2024