中文

随机森林的开放集识别

机器学习 2024-08-07 v1 机器学习

摘要

在许多实际的分类或识别任务中,由于例如训练期间知识不完整或条件不断变化,收集覆盖所有可能类别的训练样本往往困难。因此,在测试/部署时可能遇到来自未知/新类别的样本。在此类情境下,分类器应能够:i) 对已知类别进行分类,同时ii) 识别来自未知类别的样本。这称为开放集识别。尽管随机森林作为通用分类(和回归)方法框架已取得极大成功,但实际中通常在闭合集假设下运行,无法即开箱即用地识别新类别的样本。本文提出了一种新方法,通过整合距离度量学习和基于距离的开放集识别,使随机森林分类器具备开放集识别能力。该方法在人工合成数据集和真实数据集上进行了验证。实验结果表明,所提出的方法优于当前基于距离的开放集识别方法。

关键词

引用

@article{arxiv.2408.02684,
  title  = {Open Set Recognition for Random Forest},
  author = {Guanchao Feng and Dhruv Desai and Stefano Pasquali and Dhagash Mehta},
  journal= {arXiv preprint arXiv:2408.02684},
  year   = {2024}
}