面向时尚检测中标签样本分布不平衡的数据高效训练
计算机视觉与模式识别
2023-06-07 v5 人工智能
摘要
多标签分类模型在电子商务中有广泛应用,包括基于视觉的标签预测与基于语言的情感分类。在真实场景中,实现这些任务满意性能的一大挑战是数据分布的显著不平衡。例如,在时尚属性检测中,大多数电商时尚目录的 1000 件产品中可能仅有 6 件“泡袖”服装。为解决此问题,我们探索更具数据效率的模型训练技术,而非获取海量标注以收集充足样本——后者既不经济也不可扩展。本文提出一种最先进的加权目标函数,以提升深度神经网络(DNNs)在长尾数据分布多标签分类上的性能。我们的实验涉及基于图像的时尚服饰属性分类,结果表明新加权方法相较于非加权与基于逆频率的加权机制具有更优性能。我们进一步使用当今时尚行业中两种流行的时尚属性类型——袖型与原型——评估新加权机制的鲁棒性。
引用
@article{arxiv.2305.04379,
title = {Data Efficient Training with Imbalanced Label Sample Distribution for Fashion Detection},
author = {Xin Shen and Praful Agrawal and Zhongwei Cheng},
journal= {arXiv preprint arXiv:2305.04379},
year = {2023}
}
备注
We have identified a substantial error in the experimental results and a potentially misleading explanation of the algorithm. We kindly request that you consider withdrawing this version to mitigate the risk of disseminating inaccurate information