中文

人类知识集成的多模态学习用于单源域泛化

计算机视觉与模式识别 2026-03-16 v1

摘要

在糖尿病视网膜病变(DR)分级和静息态fMRI癫痫发生区(SOZ)检测等关键任务中,跨域图像分类的泛化仍具有挑战性。当域之间的差异源于未知因果因素时,实现跨域泛化困难,且缺乏评估此类差异的成熟方法,因而无法获取数据收集者通常不可接触的直接元数据或协议层面的信息。我们首先引入域互合界(DCB),一种用于评估域是否存在未知因果因素差异的理论框架。基于此,我们提出GenEval,一种结合基础模型(如MedGemma-4B)与人类知识通过低秩适配(LoRA)的多模态视觉语言模型(VLM)方法,以弥合因果差距并增强单源域泛化(SDG)。在八个DR和两个SOZ数据集上,GenEval实现了卓越的SDG性能,DR平均准确率为69.2%,SOZ为81%,分别超过最强基线9.4%和1.8%。

关键词

引用

@article{arxiv.2603.12369,
  title  = {Human Knowledge Integrated Multi-modal Learning for Single Source Domain Generalization},
  author = {Ayan Banerjee and Kuntal Thakur and Sandeep Gupta},
  journal= {arXiv preprint arXiv:2603.12369},
  year   = {2026}
}