中文

赢得 ICCV'2021 VALUE 挑战赛:基于视觉概念的任务感知集成与迁移学习

计算机视觉与模式识别 2021-10-14 v1

摘要

VALUE(视频与语言理解评测)基准新近提出,用于在检索、问答和描述生成三个视频与语言任务上评估和分析多模态表示学习算法。VALUE 挑战赛的主要目标是训练一个任务无关模型,可同时适用于具有不同特性的各类任务。本技术报告描述了我们在 VALUE 挑战赛中的夺冠策略:1) 单模型优化,2) 利用视觉概念的迁移学习,以及 3) 任务感知集成。第一与第三策略旨在应对各任务的异构特性,第二策略用于利用丰富且细粒度的视觉信息。我们提供了基于大量实验结果的详尽而全面的分析。基于我们的方法,我们在竞赛的 VALUE 与 QA 阶段均获得第一名。

关键词

引用

@article{arxiv.2110.06476,
  title  = {Winning the ICCV'2021 VALUE Challenge: Task-aware Ensemble and Transfer Learning with Visual Concepts},
  author = {Minchul Shin and Jonghwan Mun and Kyoung-Woon On and Woo-Young Kang and Gunsoo Han and Eun-Sol Kim},
  journal= {arXiv preprint arXiv:2110.06476},
  year   = {2021}
}

备注

CLVL workshop at ICCV 2021