改进分形预训练
计算机视觉与模式识别
2021-12-20 v2
摘要
现代计算机视觉系统所使用的深度神经网络需要庞大的图像数据集来进行训练。这些经过精心整理的数据集通常包含一百万或更多图像,涵盖一千或更多不同类别。创建和整理此类数据集是一项艰巨的任务,需要大量工作和标注成本,并必须谨慎应对标签准确性、版权归属和内容偏差等技术与社会问题。如果我们能有一种方法,在利用大型图像数据集力量的同时,避免或减少当前面临的主要问题和担忧,那会怎样?本文扩展了 Kataoka 等人 (2020) 的近期工作,提出了一种基于动态生成的分形图像的改进预训练数据集。大规模图像数据集的棘手问题在分形预训练中变成了优雅之处:零成本的完美标签准确性;无需存储/传输大型图像档案;由于不出现人类,无隐私/人口统计偏差/不当内容之忧;图像供应与多样性无限;且图像免费/开源。或许令人惊讶的是,避开这些困难仅在性能上带来很小的损失。借助新提出的预训练任务——多实例预测——我们的实验表明,使用分形预训练的网络经微调后达到了 ImageNet 预训练网络准确率的 92.7-98.1%。
引用
@article{arxiv.2110.03091,
title = {Improving Fractal Pre-training},
author = {Connor Anderson and Ryan Farrell},
journal= {arXiv preprint arXiv:2110.03091},
year = {2021}
}
备注
Accepted to WACV 2022. 15 pages, 15 figures. Added note about error, removed erroneous result