中文

基于元初始化的多模态融合

机器学习 2022-10-11 v1 计算机视觉与模式识别

摘要

当经验稀缺时,模型可能缺乏足够的信息来适应新任务。在这种情况下,辅助信息——例如任务的文本描述——可以实现改进的任务推断与适应。在这项工作中,我们提出对模型无关元学习算法(MAML)的扩展,使模型能够利用辅助信息以及任务经验进行适应。我们的方法,即基于元初始化的融合(FuMI),使用超网络将模型初始化条件化于辅助信息,而非学习单一的任务不可知初始化。此外,受现有多模态少样本学习基准缺陷的启发,我们构建了 iNat-Anim——一个具有简洁且视觉相关文本类描述的大规模图像分类数据集。在 iNat-Anim 上,FuMI 在少样本场景下显著优于如 MAML 等单模态基线。本项目的代码以及 iNat-Anim 的数据集探索工具公开于 https://github.com/s-a-malik/multi-few 。

关键词

引用

@article{arxiv.2210.04843,
  title  = {Multi-Modal Fusion by Meta-Initialization},
  author = {Matthew T. Jackson and Shreshth A. Malik and Michael T. Matthews and Yousuf Mohamed-Ahmed},
  journal= {arXiv preprint arXiv:2210.04843},
  year   = {2022}
}

备注

The first two authors contributed equally