基于定量域移 measures和合成场景图像的风格化域泛化 grounding
计算机视觉与模式识别
2024-05-28 v1
摘要
域泛化(DG)是机器学习中的一个具有挑战性的任务,需要能够通过提取域不变特征来理解各种域之间的偏移。DG性能通常通过在各种图像风格的域中执行图像分类来评估。然而,当前方法缺乏对风格化域偏移的定量理解,依赖大量预训练数据,如ImageNet1K,这些数据主要以照片写实风格且标签监督较弱。这种数据驱动做法可能导致虚假关联并在DG基准测试中产生夸大性能。在本文中,我们提出了一种新的DG范式来解决这些风险。我们首先引入两个新的定量措施ICV和IDD来描述域内类别一致性和域间相似性。我们然后present了SuperMarioDomains(SMD),一个从视频游戏场景中抽取的新型合成多域数据集,具有更一致的类别和与ImageNet1K相比更大的差异。我们展示了我们的DG方法SMOS。SMOS首先使用SMD训练一个前导模型,然后用于在DG基准上进行训练。我们观察到SMOS在五个DG基准测试中实现了状态最好的性能,在抽象域上取得显著提升,并在照片写实域上实现与SOTA相当或略微提升。我们的定性分析表明,这些改进可以归因于原始遥远域之间分布性差异的减少。我们的数据可在https://github.com/fpsluozi/SMD-SMOS 上获取。
引用
@article{arxiv.2405.15961,
title = {Grounding Stylistic Domain Generalization with Quantitative Domain Shift Measures and Synthetic Scene Images},
author = {Yiran Luo and Joshua Feinglass and Tejas Gokhale and Kuan-Cheng Lee and Chitta Baral and Yezhou Yang},
journal= {arXiv preprint arXiv:2405.15961},
year = {2024}
}
备注
Accepted at the 3rd CVPR Workshop on Vision Datasets Understanding