中文

面向大规模负样本数据的鲁�棒多标签分类的任意类存在概率

机器学习 2025-06-09 v1 人工智能 计算机视觉与模式识别

摘要

多标签分类(MLC)将一个实例分配到一个或多个非互斥的类别。当数据集包含大比例未分配类别的实例时(称为负样本数据),会出现挑战,这会淹没学习过程并阻碍对正实例的准确识别和分类。在许多MLC应用中都常见大量负样本数据,例如工业缺陷检测、农业病虫害识别和医疗诊断。将这些实例单独指定为负类进一步复杂化了学习目标,并引入不必要的冗余。为此,我们通过推导出预测类别概率的加权几何平均值的归一化加权形式,重新设计了标准MLC损失函数,以计算任意类别存在的概率。我们引入一个正则化参数,控制正实例中缺失类别概率对任意类别存在概率的相对贡献。任意类别存在概率补充了多标签学习,鼓励网络更加关注隐式正实例并提高这些正实例内的标签分类。在大型数据集上的实验:SewerML、修改版COCO和ChestX-ray14,以及各种网络和基础损失函数上,表明我们的损失函数在不增加额外参数或计算复杂度的情况下,持续改进了其标准损失函数 counterparts的MLC性能,F1分数提升最高可达6.01个百分点,F2分数提升8.06分,平均精度提升3.11分。代码地址:https://github.com/ML-for-Sensor-Data-Western/gmean-mlc

关键词

引用

@article{arxiv.2506.05721,
  title  = {Any-Class Presence Likelihood for Robust Multi-Label Classification with Abundant Negative Data},
  author = {Dumindu Tissera and Omar Awadallah and Muhammad Umair Danish and Ayan Sadhu and Katarina Grolinger},
  journal= {arXiv preprint arXiv:2506.05721},
  year   = {2025}
}