HyperTransformer:面向监督与半监督少样本学习的模型生成
机器学习
2022-07-15 v3 计算机视觉与模式识别
摘要
本工作中我们提出 HyperTransformer,一种基于 Transformer 的监督与半监督少样本学习模型,其直接从支撑样本生成卷积神经网络(CNN)的权重。由于小型生成式CNN模型对特定任务的依赖由高容量 Transformer 模型编码,我们有效解耦了大型任务空间的复杂度与单个任务的复杂度。我们的方法对于小型目标CNN架构尤其有效,此时学习固定的通用任务无关嵌入并非最优,而当任务信息可调制所有模型参数时能获得更好性能。对于更大模型,我们发现仅生成最后一层便能使我们得到与最先进(SOTA)方法相当或更好的结果,同时端到端可微。
引用
@article{arxiv.2201.04182,
title = {HyperTransformer: Model Generation for Supervised and Semi-Supervised Few-Shot Learning},
author = {Andrey Zhmoginov and Mark Sandler and Max Vladymyrov},
journal= {arXiv preprint arXiv:2201.04182},
year = {2022}
}