UTC:一种基于任务间对比学习的统一 Transformer 用于视觉对话
计算机视觉与模式识别
2022-05-04 v2
摘要
视觉对话旨在基于对话历史与图像内容回答多轮交互式问题。现有方法要么单独考虑答案排序与生成,要么仅通过两个独立模型隐式地弱捕捉两任务间的关系。关于在单一模型中联合学习排序与生成答案的通用框架的研究鲜有探索。本文中,我们提出一种基于对比学习的框架 UTC,以单一模型统一并促进视觉对话中的判别与生成任务。具体而言,考虑到先前学习范式的固有局限,我们设计了两种任务间对比损失,即上下文对比损失与答案对比损失,使判别与生成任务相互强化。这两种互补的对比损失以对话上下文与目标答案为锚点,从不同视角提供表示学习信号。我们在 VisDial v1.0 数据集上评估所提 UTC,该方法在判别与生成任务上均优于当前最优(state-of-the-art),并在 Recall@1 上以超过 2 个绝对点超越先前最优生成方法。
引用
@article{arxiv.2205.00423,
title = {UTC: A Unified Transformer with Inter-Task Contrastive Learning for Visual Dialog},
author = {Cheng Chen and Yudong Zhu and Zhenshan Tan and Qingrong Cheng and Xin Jiang and Qun Liu and Xiaodong Gu},
journal= {arXiv preprint arXiv:2205.00423},
year = {2022}
}
备注
Accepted in CVPR 2022