中文

小到中等数据集上的代数机器学习在强标准基线上表现竞争

机器学习 2026-05-22 v1

摘要

符号方法通常不被认为在现实监督任务上与强大的现代学习者竞争。我们在图像和表格分类上评估了代数机器学习(AML),该框架通过代数结构的亚直接分解来学习,而非数值优化。我们发现,AML 只在训练数据上进行训练,无需使用验证或交叉验证,即可战胜包括 CNN 在内的交叉验证基线方法。对于小到中等图像数据集(50--2000 个训练样本),AML 在不使用验证或交叉验证的情况下训练, outperforms 采用任务特定偏置的 LightGBM 和随机森林等方法。AML 使用一种通用的代数归纳偏置,而非像 CNN 那样针对图像或 XGBoost 针对表格数据的模式特定偏置,实现了在两种截然不同的数据集上的竞争性能,而且不需要调整任务依赖的超参数。

关键词

引用

@article{arxiv.2605.22155,
  title  = {Algebraic Machine Learning for Small-to-Medium Datasets Is Competitive against Strong Standard Baselines},
  author = {David Mendez and Fernando Martin-Maroto and Gonzalo G. de Polavieja},
  journal= {arXiv preprint arXiv:2605.22155},
  year   = {2026}
}

备注

9 pages, 4 figures