增强图像先验:从单张图像外推蒸馏千类物体
计算机视觉与模式识别
2023-01-25 v4
摘要
当仅以单张图像作为输入时,神经网络能了解到关于视觉世界的什么信息?尽管任何图像显然都无法包含现存所有物体、场景与光照条件——但在所有 256^(3x224x224) 张可能的 224 尺寸正方形图像的空间中,它仍可能为自然图像提供强大的先验。为分析这一“增强图像先验”假设,我们开发了一个简单框架,使用单张图像及增广,并通过来自有监督预训练教师模型的知识蒸馏从零训练神经网络。由此,我们发现上述问题的答案是:“令人惊讶地,非常多”。在量化指标上,我们在 CIFAR-10/100 上分别取得 94%/74% 的准确率,在 ImageNet 上为 69%,并将该方法扩展到视频与音频后,在 Kinetics-400 上达 51%、在 SpeechCommands 上达 84%。在跨越 13 个数据集的广泛分析中,我们解耦了增广、数据选择与网络架构的影响,并提供了定性评估,包括在从未见过熊猫的网络中出现的清晰“熊猫神经元”。
引用
@article{arxiv.2112.00725,
title = {The Augmented Image Prior: Distilling 1000 Classes by Extrapolating from a Single Image},
author = {Yuki M. Asano and Aaqib Saeed},
journal= {arXiv preprint arXiv:2112.00725},
year = {2023}
}
备注
Accepted at ICLR'23. Webpage: https://single-image-distill.github.io/, code: https://github.com/yukimasano/single-img-extrapolating