探究语义尺度不平衡
计算机视觉与模式识别
2023-04-11 v8 人工智能
机器学习
摘要
由长尾数据引发的模型偏置已被广泛研究。然而,基于样本数量的度量无法同时解释三种现象:(1) 给定充足数据,分类性能随额外样本的增加而边际增益微弱。(2) 当数据不足时,分类性能随训练样本减少而急剧衰退。(3) 在样本均衡数据集上训练的模型对不同类别仍有不同偏置。本工作中,我们定义并量化了类别的语义尺度,用以度量类别的特征多样性。实验令人兴奋地发现语义尺度存在边际效应,完美描述了前两种现象。进一步,提出了语义尺度不平衡的量化度量,其能准确反映多个数据集上(即便在样本均衡数据上)的模型偏置,揭示了类不平衡研究的新视角。鉴于语义尺度不平衡的普遍性,我们提出语义尺度均衡学习,包含一种通用损失改进方案与一个动态重加权训练框架,克服了迭代中实时计算语义尺度的挑战。综合实验表明,动态语义尺度均衡学习持续使模型在大规模长尾与非长尾自然及医学数据集上表现优越,是缓解这一普遍却被忽视的模型偏置的良好起点。
引用
@article{arxiv.2212.14613,
title = {Delving into Semantic Scale Imbalance},
author = {Yanbiao Ma and Licheng Jiao and Fang Liu and Yuxin Li and Shuyuan Yang and Xu Liu},
journal= {arXiv preprint arXiv:2212.14613},
year = {2023}
}
备注
47 pages, 26 figures, 12 tables, Published as a conference paper at ICLR 2023