基于可解释视觉Transformer的手部图像分类的自适应知识蒸馏
计算机视觉与模式识别
2024-08-21 v1 人工智能
机器学习
摘要
评估手部图像的法医价值涉及利用个体手部中存在的独特特征和模式。人体手部具有独特特征,如静脉模式、指纹和手部本身的几何结构。本文研究了使用视觉Transformer(ViTs)进行手部图像分类。我们使用可解释性工具探索 ViTs 的内部表示,并评估其对模型输出的影响。利用对 ViTs 的内部理解,我们引入了蒸馏方法,使学生模型能够在不同领域的数据上学习时自适应地从教师模型中提取知识,以防止灾难性遗忘。使用两个公开可用的手部图像数据集进行了一系列实验,以评估 ViTs 和所提出的自适应蒸馏方法的性能。实验结果表明 ViT 模型显著优于传统机器学习方法,且 ViTs 的内部状态有助于解释分类任务中的模型输出。通过避免灾难性遗忘,我们的蒸馏方法在源域和目标域数据上均取得了优异性能,特别是在这两个域表现出显著差异时。因此,所提出的方法可以有效开发和实施于访问控制、身份验证和认证系统等现实应用。
引用
@article{arxiv.2408.10503,
title = {Adaptive Knowledge Distillation for Classification of Hand Images using Explainable Vision Transformers},
author = {Thanh Thi Nguyen and Campbell Wilson and Janis Dalins},
journal= {arXiv preprint arXiv:2408.10503},
year = {2024}
}
备注
Accepted at the ECML PKDD 2024 (Research Track)