CIFAR-10-Warehouse:模型泛化分析中更广泛且更真实的测试平台
计算机视觉与模式识别
2024-03-14 v3
摘要
分析模型在各种未见环境中的性能是机器学习社区中的一个关键研究问题。为研究该问题,构建具有广泛覆盖环境差异的分布外测试集的测试平台十分重要。然而,现有测试平台通常要么域数量少,要么由图像损坏合成,阻碍了能展现真实世界有效性的算法设计。本文中,我们引入 CIFAR-10-Warehouse,其由通过以各种方式提示图像搜索引擎与扩散模型收集的 180 个数据集构成。数据集规模通常介于 300 至 8,000 张图像之间,包含自然图像、卡通、特定颜色或不自然出现的物体。借助 CIFAR-10-W,我们旨在增强对两项泛化任务的评估并加深理解:域泛化与各种分布外环境中的模型精度预测。我们进行了广泛的基准测试与对比实验,表明 CIFAR-10-W 为这些任务提供了新颖且有趣的洞见。我们也讨论了其他将受益于 CIFAR-10-W 的领域。
引用
@article{arxiv.2310.04414,
title = {CIFAR-10-Warehouse: Broad and More Realistic Testbeds in Model Generalization Analysis},
author = {Xiaoxiao Sun and Xingjian Leng and Zijian Wang and Yang Yang and Zi Huang and Liang Zheng},
journal= {arXiv preprint arXiv:2310.04414},
year = {2024}
}
备注
ICLR 2024. https://sites.google.com/view/CIFAR-10-warehouse/