中文

未见者几何取决于关于已见者的信息

机器学习 2025-03-11 v2 神经与进化计算 机器学习

摘要

缺失质量是指在分类器输入的未知总体中,属于分类器训练数据中不存在的类别的数据点比例,其中训练数据被假设为从该未知总体中抽取的随机样本。我们发现,在期望意义上,缺失质量完全由在训练数据中出现相同次数的类别数 fkf_k 和一个指数衰减误差决定。虽然这是对样本中期望缺失质量的首次精确刻画,但由此导出的估计量存在不切实际的高方差。然而,我们的理论提出了一个几乎无偏估计量的大型搜索空间,可以对其进行有效且高效的搜索。因此,我们将无分布估计转化为一个优化问题,以在仅给定样本的情况下,找到一个具有最小均方误差 (MSE) 的特定分布估计量。在我们的实验中,我们的搜索算法发现的估计量的 MSE 远小于最先进的 Good-Turing 估计量。当样本数量至少与类别数量一样多时,在超过 93% 的运行中均成立。我们的估计量的 MSE 约为 Good-Turing 估计量的 80%。

关键词

引用

@article{arxiv.2402.05835,
  title  = {How Much is Unseen Depends Chiefly on Information About the Seen},
  author = {Seongmin Lee and Marcel Böhme},
  journal= {arXiv preprint arXiv:2402.05835},
  year   = {2025}
}

备注

13 pages, 11 pages of appendix, ICLR'25