随机森林的开放集识别
机器学习
2024-08-07 v1 机器学习
摘要
在许多实际的分类或识别任务中,由于例如训练期间知识不完整或条件不断变化,收集覆盖所有可能类别的训练样本往往困难。因此,在测试/部署时可能遇到来自未知/新类别的样本。在此类情境下,分类器应能够:i) 对已知类别进行分类,同时ii) 识别来自未知类别的样本。这称为开放集识别。尽管随机森林作为通用分类(和回归)方法框架已取得极大成功,但实际中通常在闭合集假设下运行,无法即开箱即用地识别新类别的样本。本文提出了一种新方法,通过整合距离度量学习和基于距离的开放集识别,使随机森林分类器具备开放集识别能力。该方法在人工合成数据集和真实数据集上进行了验证。实验结果表明,所提出的方法优于当前基于距离的开放集识别方法。
引用
@article{arxiv.2408.02684,
title = {Open Set Recognition for Random Forest},
author = {Guanchao Feng and Dhruv Desai and Stefano Pasquali and Dhagash Mehta},
journal= {arXiv preprint arXiv:2408.02684},
year = {2024}
}