利用数据半径、硬间隔与软间隔的快速基于 SVM 的特征消除
摘要
本文将 MFE-LO 方法提出的硬间隔意义下的间隔最大化(作为特征消除准则)与数据半径利用相结合,旨在进一步降低泛化误差,因为若干已发表的关于降低误分类风险(或误差)的界及其相关公式均涉及半径,例如半径平方与权重向量范数平方的乘积。此外,我们提出了额外的新颖特征消除准则,这些准则虽处于软间隔意义下,但同样可利用数据半径,利用了先前发表的针对软间隔意义下半径逼近的界相关公式,其中例如重点在于所述原则:“寻找一个其最小值位于留一值较小区域的界,可能比界的紧密性更为重要”。我们提出的这些额外准则将半径利用与我们设计的一种新颖且计算成本低廉的软间隔轻量级分类器重训练方法(命名为 QP1)相结合;QP1 是硬间隔 LO 的软间隔替代方案。我们修正了 MFE-LO 描述中的一个错误,发现 MFE-LO 在先前发表的基于间隔的特征消除 (MFE) 方法中实现了最高的泛化精度,讨论了 MFE-LO 的一些局限性,并发现本文提出的新颖方法优于 MFE-LO,取得了更低的测试集分类错误率。在多个既具有大量特征又属于“大特征小样本”类别的数据集上,以及在特征数量较少(低至中等)的数据集上,我们的新颖方法均给出了令人鼓舞的结果。特别是,在我们提出的可调节方法中(即不采用不可调节的 LO 方法的那些),未来可以进行更激进的调优,以期展现出比本文更高的性能。
引用
@article{arxiv.1210.4460,
title = {Fast SVM-based Feature Elimination Utilizing Data Radius, Hard-Margin, Soft-Margin},
author = {Yaman Aksu},
journal= {arXiv preprint arXiv:1210.4460},
year = {2014}
}
备注
Incomplete but good, again. To Apr 28 version, made few misc text and notation improvements including typo corrections, probably mostly in Appendix, but probably best to read in whole again. New results for one of the datasets (Leukemia gene dataset)