无需正则化:一种高效且有效的不完全标签分布学习模型
机器学习
2024-06-11 v1 机器学习
摘要
标签分布学习(LDL)为样本分配软标签(即程度值)。现实中,获取完整的程度值总是费时费力,从而催生了不完全 LDL(InLDL)。然而,InLDL 常遭遇性能退化。为弥补此缺陷,现有方法需要一个或多个显式正则化,导致繁重的参数调优与额外计算。我们认为标签分布本身可能提供有用先验,若恰当利用,InLDL 问题可在无任何显式正则化下求解。本文给出了一种利用该先验的合理替代方案。我们的直觉是:大程度值更易受关注,小程度值易被忽视,而缺失程度值在 InLDL 中则完全被忽略。为学习准确的标签分布,关键是不忽略小的观测程度值而是赋予其适当大的权重,同时逐步增大缺失程度值的权重。为此,我们首先定义加权经验风险并推导期望风险与加权经验风险间的上界,从原理上揭示加权起到隐式正则化作用。进而,利用程度值先验,我们设计了一种加权方案并验证其有效性。综上,我们的模型具四方面优势:1)免模型选择,因未施加显式正则化;2)具闭式解(子问题)且易实现(数行代码);3)对样本数呈线性计算复杂度,故可扩展至大数据集;4)即便无任何显式正则化仍可与 SOTA 方法竞争。
引用
@article{arxiv.2308.07047,
title = {No Regularization is Needed: An Efficient and Effective Model for Incomplete Label Distribution Learning},
author = {Xiang Li and Songcan Chen},
journal= {arXiv preprint arXiv:2308.07047},
year = {2024}
}
备注
9 pages, 4 figures