中文

面向少数标签的多模态域泛化

计算机视觉与模式识别 2026-02-27 v1

摘要

多模态模型理想情况下应该能够在未见域上进行泛化,同时保持数据高效以降低标注成本。为此,我们引入并研究了一种新问题——半监督多模态域泛化(SSMDG),旨在从多源数据中仅用少量标注样本学习鲁棒的多模态模型。我们观察到现有方法未能有效解决此设置:多模态域泛化方法无法利用未标注数据,半监督多模态学习方法忽略了域迁移,而半监督域泛化方法仅限于单模态输入。为克服这些限制,我们提出了一个统一框架,包含三个关键组件:一致性驱动的一致性正则化,通过可信赖的融合-单模态一致性获得可靠伪标签;不一致感知的正则化,有效利用模糊的非一致性样本;跨模态原型对齐,强制域-和模态不变的表征,同时通过跨模态翻译促进在缺失模态下的鲁棒性。我们进一步建立了第一个SSMDG基准测试,在上述基准测试上,我们的方法在标准场景和缺失模态场景中均 consistently 优于强基线。我们的基准和代码均可用于 https://github.com/lihongzhao99/SSMDG。

关键词

引用

@article{arxiv.2602.22917,
  title  = {Towards Multimodal Domain Generalization with Few Labels},
  author = {Hongzhao Li and Hao Dong and Hualei Wan and Shupan Li and Mingliang Xu and Muhammad Haris Khan},
  journal= {arXiv preprint arXiv:2602.22917},
  year   = {2026}
}

备注

Accepted to CVPR 2026