基于条件批量归一化的多模态元学习辅助任务调制极限研究
计算机视觉与模式识别
2024-05-31 v2 人工智能
摘要
少样本学习旨在学习能在给定少量示例的情况下解决新任务的表示。最近的研究表明,跨模态学习可以提高少样本分类的表示。在此基础上,语言是一种丰富的模态,可用于指导视觉学习。在本文中,我们实验了一种用于少样本学习的多模态架构,包含三个组件:分类器、辅助网络和桥接网络。虽然分类器执行主要分类任务,但辅助网络学习从同一输入预测语言表示,桥接网络将辅助网络的高级特征转换为使用条件批量归一化作用于少样本分类器各层的调制参数。桥接应鼓励语言和视觉之间轻量级语义对齐,这对分类器可能有用。然而,经过在两个流行少样本分类基准上的评估,我们发现:a)改进在基准之间无法复现,且b)当改进确实存在时,是由于桥接网络引入的额外计算和参数所致。我们为未来在多模态元学习中的工作提供了见解和建议,尤其是当使用语言表示时。
引用
@article{arxiv.2405.18751,
title = {On the Limits of Multi-modal Meta-Learning with Auxiliary Task Modulation Using Conditional Batch Normalization},
author = {Jordi Armengol-Estapé and Vincent Michalski and Ramnath Kumar and Pierre-Luc St-Charles and Doina Precup and Samira Ebrahimi Kahou},
journal= {arXiv preprint arXiv:2405.18751},
year = {2024}
}