MoMBS:混合阶数 minibatch 采样提升多样化质量图像模型训练
计算机视觉与模式识别
2025-05-27 v1 人工智能
摘要
自然图像在带噪标签图像分类中表现出标签多样性 (干净 vs 噪声),在长尾图像分类中表现出流行度多样性 (丰富 vs 稀疏)。类似地,医学图像在通用病灶检测 (ULD) 中也表现出显著的图像质量差异,包括清晰度和标签正确性等属性。如何有效地利用具有不同质量的训练图像成为深度模型学习中的一个问题。常规的训练机制,如自洽课程学习 (SCL) 和在线硬例挖掘 (OHEM),通过对高损失值的图像进行重新加权来缓解这一问题。尽管这些方法取得了成功,但仍面临两个挑战:(i) 基于损失值的样本难度度量不够精确,阻碍对不同情况的最佳处理;(ii) SCL 或 OHEM 在识别出的硬样本上存在低利用率或过度利用。为此,本文重访 minibatch 采样 (MBS) 这一技术——在深度网络训练中广泛使用,但在处理多样化质量训练样本方面鲜有探讨。我们发现 minibatch 中的样本在训练期间相互影响;因此,我们提出一种新的混合阶数 minibatch 采样 (MoMBS) 方法,以优化多样化质量训练样本的使用。MoMBS 引入一种度量,考虑损失和不确定性,以超越仅依赖损失,允许对高损失样本进行更细致的分类,将其区分为“标签不良且稀疏表示”或“稳健表示且过拟合”。我们优先将稀疏表示的样本作为 minibatch 中的主要梯度贡献者,并通过混合阶数 minibatch 采样设计,将其从标签不良或过拟合样本的负面影响中隔离。
引用
@article{arxiv.2505.18741,
title = {MoMBS: Mixed-order minibatch sampling enhances model training from diverse-quality images},
author = {Han Li and Hu Han and S. Kevin Zhou},
journal= {arXiv preprint arXiv:2505.18741},
year = {2025}
}
备注
16 pages,8 figures