OneCAD:基于多模态学习的通用图像数据集单一分类器
计算机视觉与模式识别
2023-05-15 v1 计算与语言
机器学习
图像与视频处理
摘要
视觉Transformer(ViTs)与卷积神经网络(CNNs)是广泛用于分类任务的深度神经网络(DNNs)。这些模型架构依赖于其所训练数据集的类别数。类别数的任何改变都会导致模型架构的改变(部分或全部)。本工作探讨一个问题:是否可能创建一种与类别数无关的模型架构?这使得模型架构独立于其所训练的数据集。本工作指出了当前架构(ViTs 与 CNNs)存在的问题,并提出了一种训练与推理框架 OneCAD(通用图像数据集单一分类器),以实现近似类别数无关的 Transformer 模型。据我们所知,这是首个将掩码图像建模(MIM)与多模态学习结合用于分类任务以创建类别数无关的 DNN 模型架构的工作。初步结果展示在自然与医学图像数据集上。数据集:MNIST、CIFAR10、CIFAR100 与 COVIDx。代码将很快在 github 上公开。
引用
@article{arxiv.2305.07167,
title = {OneCAD: One Classifier for All image Datasets using multimodal learning},
author = {Shakti N. Wadekar and Eugenio Culurciello},
journal= {arXiv preprint arXiv:2305.07167},
year = {2023}
}
备注
8 pages, 6 figures