跨模态检索中的持续学习
计算机视觉与模式识别
2021-04-20 v2
摘要
多模态表示与持续学习是两个与人类智能密切相关的领域。前者关注共享表示空间的学习,其中来自不同模态的信息可被比较与整合(我们聚焦于语言与视觉表示之间的跨模态检索)。后者研究在学习新任务时如何避免遗忘先前已学习的任务。尽管人类在这两方面表现出色,深度神经网络仍相当受限。本文提出将上述两个问题结合为一种持续跨模态检索设定,研究新任务引起的灾难性干扰如何影响嵌入空间及其对有效检索所需的跨模态对齐。我们提出一个将训练、索引与查询阶段解耦的通用框架。我们还识别并研究了可能导致遗忘的不同因素,并提出缓解工具。我们发现索引阶段起着重要作用,且简单地避免用更新后的嵌入网络重新索引数据库即可带来显著增益。我们在两个图像-文本检索数据集上评估了我们的方法,相对于微调基线取得了显著改进。
引用
@article{arxiv.2104.06806,
title = {Continual learning in cross-modal retrieval},
author = {Kai Wang and Luis Herranz and Joost van de Weijer},
journal= {arXiv preprint arXiv:2104.06806},
year = {2021}
}
备注
2nd CLVISION workshop in CVPR 2021