基于关系迁移的多模态域自适应指代表达定位
计算机视觉与模式识别
2023-09-26 v1
摘要
域自适应旨在不同域之间迁移知识,在图像分类和目标检测等诸多领域已得到充分研究。然而,对于多模态任务,传统方法依赖于大规模预训练。但由于多模态数据获取困难,大规模预训练往往不切实际。因此,能够有效利用来自不同数据集(域)知识的域自适应,对多模态任务至关重要。本文关注指代表达定位(REG)任务,即定位由自然语言表达式描述的图像区域。具体而言,我们提出一种新颖的方法,通过专为 REG 问题设计的特定关系定制方法,有效迁移多模态知识。我们的方法通过同时丰富域间关系并迁移域间关系,解决多模态域自适应问题。实验表明,我们提出的方法显著提升了多模态域的可迁移性,并增强了 REG 问题中的自适应性能。
引用
@article{arxiv.2309.13247,
title = {Multi-modal Domain Adaptation for REG via Relation Transfer},
author = {Yifan Ding and Liqiang Wang and Boqing Gong},
journal= {arXiv preprint arXiv:2309.13247},
year = {2023}
}