中文

Case-Enhanced Vision Transformer: 用于改进图像相似性解释的基于 ViT 的相似度度量方法

计算机视觉与模式识别 2024-07-25 v1 人工智能

摘要

本短文 presented 初步研究,提出了 Case-Enhanced Vision Transformer (CEViT),一种旨在提高图像数据相似性评估可解释性的相似度测量方法。初始实验结果表明,将 CEViT 集成到 k 近邻(k-NN)分类中,可获得与最先进计算机视觉模型相当的分类准确率,同时添加了用于说明类别间差异的能力。CEViT 的解释可以受到先前案例的影响,以说明与这些案例相关的相似性方面。

关键词

引用

@article{arxiv.2407.16981,
  title  = {Case-Enhanced Vision Transformer: Improving Explanations of Image Similarity with a ViT-based Similarity Metric},
  author = {Ziwei Zhao and David Leake and Xiaomeng Ye and David Crandall},
  journal= {arXiv preprint arXiv:2407.16981},
  year   = {2024}
}