通过自监督学习实现多模态开集域泛化与迁移
计算机视觉与模式识别
2024-07-02 v1 人工智能
机器学习
摘要
开集域泛化 (open-set domain generalization, OSDG) 涉及在未见域中识别新类,这在多模态输入下更具挑战性。现有工作仅在元学习框架下针对单模态 OSDG,未考虑多模态情形。本文首次提出解决多模态开集域泛化 (MM-OSDG) 的方法,利用自监督学习。为此,我们引入两种创新的多模态自监督预文本任务:掩码跨模态翻译和多模态拼图。这些任务促进学习多模态特征表示,从而增强泛化能力和开放类别检测性能。此外,我们提出了新颖的熵权重机制,在不同模态之间平衡损失。我们还将方法扩展到解决多模态开集域迁移 (MM-OSDA) 问题,尤其是在目标域无标签数据可用的情形。在 EPIC-Kitchens 和 HAC 数据集上,分别在 MM-OSDG、MM-OSDA 和多模态封闭集 DG 设置下进行了广泛实验,证明了所提方法的有效性与灵活性。我们的源代码已发布于 https://github.com/donghao51/MOOSA。
引用
@article{arxiv.2407.01518,
title = {Towards Multimodal Open-Set Domain Generalization and Adaptation through Self-supervision},
author = {Hao Dong and Eleni Chatzi and Olga Fink},
journal= {arXiv preprint arXiv:2407.01518},
year = {2024}
}
备注
Accepted by ECCV 2024, code: https://github.com/donghao51/MOOSA