中文

多模态数据能否改进少样本学习?

计算机视觉与模式识别 2021-07-27 v1

摘要

大多数少样本学习模型仅利用单一模态数据。我们欲从定性与定量角度探究,若加入额外模态(即图像的文字描述),模型能提升多少,以及它如何影响学习过程。为实现该目标,我们提出四类融合方法以结合图像特征与文本特征。为验证改进有效性,我们在两种经典少样本学习模型——ProtoNet 与 MAML 上测试这些融合方法,并使用 ConvNet 与 ResNet12 等图像特征提取器。基于注意力的融合方法表现最佳,相较于基线结果将分类准确率大幅提升了约 30%。

关键词

引用

@article{arxiv.2107.11853,
  title  = {Will Multi-modal Data Improves Few-shot Learning?},
  author = {Zilun Zhang and Shihao Ma and Yichun Zhang},
  journal= {arXiv preprint arXiv:2107.11853},
  year   = {2021}
}

备注

Project Report