多模态目标识别的鲁棒域迁移
计算机视觉与模式识别
2024-08-13 v1 人工智能
摘要
在多标签分类中,机器学习在处理分布与训练数据不同的任务时面临域迁移挑战。现有方法主要关注视觉目标识别,忽略了自然语言的集成。近期视觉语言预训练技术利用大量视觉语言配对的监督信息,实现跨域学习并增强多模态场景下的识别能力。然而,这些方法在损失函数利用、不同 backbone 的通用性以及类别感知视觉融合方面存在局限。本文通过推断实际损失、扩展至更大尺度的视觉语言 backbone,并引入 Mixup-CLIPood 以增强类别感知视觉融合,提出针对这些局限的解决方案。我们的方法在多个数据集上显示出在域迁移任务中的优异性能。
引用
@article{arxiv.2408.05831,
title = {Robust Domain Generalization for Multi-modal Object Recognition},
author = {Yuxin Qiao and Keqin Li and Junhong Lin and Rong Wei and Chufeng Jiang and Yang Luo and Haoyu Yang},
journal= {arXiv preprint arXiv:2408.05831},
year = {2024}
}
备注
6 pages, 2 figures. This is a preprint version of the article. The final version will be published in the proceedings of the IEEE conference