中文

论多域长尾识别、不平衡域泛化及更一般情形

机器学习 2022-08-02 v3 人工智能 计算机视觉与模式识别

摘要

现实世界数据常呈现不平衡的标签分布。现有关于数据不平衡的研究聚焦于单域设定,即样本来自同一数据分布。然而,自然数据可源自不同域,其中某一域中的少数类可能在其他域拥有大量实例。我们形式化了多域长尾识别(MDLT)任务,它从多域不平衡数据中学习,处理标签不平衡、域偏移及跨域分歧的标签分布,并泛化到所有域-类对。我们首先构建了域-类可迁移性图,并表明此种可迁移性决定了 MDLT 中学习的成败。随后我们提出 BoDA,一种理论奠基的学习策略,追踪可迁移性统计的上界,并确保跨不平衡域-类分布的均衡对齐与校准。我们基于广泛使用的多域数据集整理了五个 MDLT 基准,并将 BoDA 与涵盖不同学习策略的二十种算法比较。大量严谨实验验证了 BoDA 的优越性能。此外,作为副产品,BoDA 在域泛化基准上确立了新的 SOTA,凸显了解决跨域数据不平衡的重要性,这对提升对未见域的泛化能力至关重要。代码与数据可在:https://github.com/YyzHarry/multi-domain-imbalance 获取。

关键词

引用

@article{arxiv.2203.09513,
  title  = {On Multi-Domain Long-Tailed Recognition, Imbalanced Domain Generalization and Beyond},
  author = {Yuzhe Yang and Hao Wang and Dina Katabi},
  journal= {arXiv preprint arXiv:2203.09513},
  year   = {2022}
}

备注

ECCV 2022