中文

多模态目标识别的鲁棒域迁移

计算机视觉与模式识别 2024-08-13 v1 人工智能

摘要

在多标签分类中,机器学习在处理分布与训练数据不同的任务时面临域迁移挑战。现有方法主要关注视觉目标识别,忽略了自然语言的集成。近期视觉语言预训练技术利用大量视觉语言配对的监督信息,实现跨域学习并增强多模态场景下的识别能力。然而,这些方法在损失函数利用、不同 backbone 的通用性以及类别感知视觉融合方面存在局限。本文通过推断实际损失、扩展至更大尺度的视觉语言 backbone,并引入 Mixup-CLIPood 以增强类别感知视觉融合,提出针对这些局限的解决方案。我们的方法在多个数据集上显示出在域迁移任务中的优异性能。

关键词

引用

@article{arxiv.2408.05831,
  title  = {Robust Domain Generalization for Multi-modal Object Recognition},
  author = {Yuxin Qiao and Keqin Li and Junhong Lin and Rong Wei and Chufeng Jiang and Yang Luo and Haoyu Yang},
  journal= {arXiv preprint arXiv:2408.05831},
  year   = {2024}
}

备注

6 pages, 2 figures. This is a preprint version of the article. The final version will be published in the proceedings of the IEEE conference