中文

MELTR:用于学习微调视频基础模型的元损失Transformer

计算机视觉与模式识别 2023-03-24 v1

摘要

基础模型在各个领域中展现出了卓越的性能与泛化能力。由于大多数关于基础模型的研究主要关注预训练阶段,微调时通常采用最小化单一任务特定损失的朴素策略。然而,此类微调方法并未充分利用对目标任务潜在有益的其他损失。因此,我们提出了MEta Loss TRansformer(MELTR),这是一个插件式模块,可自动且非线性地组合多种损失函数,通过辅助学习来帮助学习目标任务。我们将辅助学习表述为一个双层优化问题,并提出了一种基于近似隐式微分(AID)的高效优化算法。在评估中,我们将该框架应用于多种视频基础模型(UniVL、Violet和All-in-one),并在全部四个下游任务上展示了显著的性能提升:文本到视频检索、视频问答、视频描述生成和多模态情感分析。我们的定性分析表明,MELTR恰当地“变换”了各个损失函数,并将其“融合”为一个有效的统一损失。代码已发布于 https://github.com/mlvlab/MELTR。

关键词

引用

@article{arxiv.2303.13009,
  title  = {MELTR: Meta Loss Transformer for Learning to Fine-tune Video Foundation Models},
  author = {Dohwan Ko and Joonmyung Choi and Hyeong Kyu Choi and Kyoung-Woon On and Byungseok Roh and Hyunwoo J. Kim},
  journal= {arXiv preprint arXiv:2303.13009},
  year   = {2023}
}

备注

Accepted paper at CVPR 2023