FAME-ViL:面向异构时尚任务的多任务视觉-语言模型
计算机视觉与模式识别
2023-03-07 v1
摘要
在时尚领域,存在多种视觉-语言(V+L)任务,包括跨模态检索、文本引导图像检索、多模态分类和图像描述。它们在各自的输入/输出格式和数据集规模上差异显著。通常的做法是设计特定于任务的模型,并从预训练的 V+L 模型(如 CLIP)独立微调。这导致参数效率低下且无法利用任务间的相关性。为解决这些问题,我们在本工作中提出一种新颖的面向时尚的视觉-语言任务多任务高效学习方法(FAME-ViL)。与现有方法相比,FAME-ViL 对多个异构时尚任务使用单一模型,因而参数效率更高。其由两个新颖组件实现:(1)一个具有集成到统一 V+L 模型中的交叉注意力适配器和任务特定适配器的任务通用架构;(2)一种稳定有效的多任务训练策略,支持从异构数据学习并防止负迁移。在四个时尚任务上的大量实验表明,我们的 FAME-ViL 相比替代方案可节省 61.5% 的参数,同时显著优于常规独立训练的单任务模型。代码见 https://github.com/BrandonHanx/FAME-ViL。
引用
@article{arxiv.2303.02483,
title = {FAME-ViL: Multi-Tasking Vision-Language Model for Heterogeneous Fashion Tasks},
author = {Xiao Han and Xiatian Zhu and Licheng Yu and Li Zhang and Yi-Zhe Song and Tao Xiang},
journal= {arXiv preprint arXiv:2303.02483},
year = {2023}
}
备注
CVPR 2023