Dist Loss:通过分布距离约束增强少样本区域的回归
机器学习
2025-03-31 v3 人工智能
摘要
不平衡的数据分布在现实场景中广泛存在,为不平衡分类和不平衡回归任务带来了重大挑战。它们常常导致深度学习模型在高样本密度区域(many-shot区域)过拟合,而在低样本密度区域(few-shot区域)表现不佳。这种特征限制了深度学习模型在各个领域的实用性,尤其是在医疗保健领域,低样本密度区域的临床相关性更大。虽然最近的研究表明,在不平衡分类任务中纳入分布信息有益,但此类策略在不平衡回归中很少被探索。本文通过引入一种新型损失函数,称为Dist Loss,旨在以可微方式最小化模型预测值与目标标签之间的分布距离,有效地将分布信息集成到模型训练中。Dist Loss使深度学习模型能够在训练期间对其输出分布进行正则化,从而有效增强其对few-shot区域的关注。我们在三个覆盖计算机视觉和医疗保健领域的数据集上进行了大量实验:IMDB-WIKI-DIR、AgeDB-DIR和ECG-Ka-DIR。结果表明,Dist Loss有效缓解了不平衡数据分布对模型性能的负面影响,在稀疏数据区域实现了最先进的效果。此外,Dist Loss易于集成,补充现有方法。
引用
@article{arxiv.2411.15216,
title = {Dist Loss: Enhancing Regression in Few-Shot Region through Distribution Distance Constraint},
author = {Guangkun Nie and Gongzheng Tang and Shenda Hong},
journal= {arXiv preprint arXiv:2411.15216},
year = {2025}
}