中文

合并具有多重协变量偏移和不平衡的图像数据集

机器学习 2024-11-19 v3 计算机视觉与模式识别

摘要

小样本量在许多学科中很常见,这使得有必要合并来自多个机构的粗略相似数据集,以研究图像与疾病结果之间微弱但相关的关联。此类数据通常在协变量(即次要非成像数据)中表现出偏移/不平衡。在标准统计分析中,控制此类干扰变量很常见,但这些思想并不直接适用于过参数化模型。因此,最近的工作表明,来自不变表示学习的策略提供了一个有意义的起点,但当前的方法库仅限于一次处理少数几个协变量的偏移/不平衡。在本文中,我们展示了如何从范畴论的角度看待这一问题,从而提供一个简单有效的解决方案,完全避免了原本需要的复杂多阶段训练流程。我们通过对真实数据集的广泛实验展示了该方法的有效性。此外,我们讨论了这种表述风格如何为至少 5 种以上不同的问题设置提供统一视角,范围从自监督学习到三维重建中的匹配问题。

关键词

引用

@article{arxiv.2403.02598,
  title  = {Pooling Image Datasets With Multiple Covariate Shift and Imbalance},
  author = {Sotirios Panagiotis Chytas and Vishnu Suresh Lokhande and Peiran Li and Vikas Singh},
  journal= {arXiv preprint arXiv:2403.02598},
  year   = {2024}
}