中文

基于多模态先验知识的鲁棒视觉表征学习:用于分布迁移下的图像分类

计算机视觉与模式识别 2025-02-13 v2 机器学习

摘要

尽管深度神经网络(DNN)在计算机视觉领域取得了显著成功,但面对训练数据与测试数据之间的分布迁移时,性能仍未能保持。本文提出了知识引导的视觉表征学习(KGV)——一种基于分布的学习方法,利用多模态先验知识以提高分布迁移下的泛化能力。它整合了两种不同模态的知识:1)具有层次性和关联关系的知识图谱(KG);以及2)从KG中语义表示的视觉元素的生成合成图像。这些嵌入通过一种新型的翻译基KG嵌入方法在统一的潜在空间中对齐,即来自原始图像和合成图像的视觉嵌入以及知识图谱嵌入(KGE)。我们声称,整合多模型先验知识可实现更规范的图像表征学习,从而使模型能够更好地跨越不同数据分布进行泛化。我们在各种带有主要或次要分布迁移的图像分类任务上进行了评估,包括来自德国、中国和俄罗斯的道路标志分类、mini-ImageNet数据集及其变体,以及DVM-CAR数据集。结果表明,KGV在所有实验中均表现出更高的准确率和数据效率。

关键词

引用

@article{arxiv.2410.15981,
  title  = {Robust Visual Representation Learning with Multi-modal Prior Knowledge for Image Classification Under Distribution Shift},
  author = {Hongkuan Zhou and Lavdim Halilaj and Sebastian Monka and Stefan Schmid and Yuqicheng Zhu and Bo Xiong and Steffen Staab},
  journal= {arXiv preprint arXiv:2410.15981},
  year   = {2025}
}