中文

主动分区:颠覆主动学习范式的算法

机器学习 2025-12-02 v1

摘要

数据集常常包含与不同方面或情境相关的各种功能模式,这些模式通常在数据集中并不等方式呈现。我们提出一种新型、通用的分区算法,通过多个模型之间的竞争来检测和分离这些功能模式。这种竞争通过多个模型迭代地提交对数据集的预测来实现,其中每个数据点的最佳预测将获得在该数据点的训练奖励。这种奖励机制放大了每个模型的优势,并鼓励其在不同模式上专业化。然后,这些专业化可转化为分区方案。对每个模型优势的放大颠覆了主动学习范式:而主动学习通常致力于聚焦模型在其弱点上的训练,以最小化所需训练数据的数量;我们的概念则强化每个模型的优势,从而使其专业化。我们以各种包含明确不同功能模式的数据集验证了我们的概念,如多孔结构中的机械应力和应变数据。主动分区算法为数据集结构提供了有价值的洞察,可用于各种后续应用。作为一个典型用例,我们设置由多个专家模型组成的模块化模型,其中每个模型学习单个分区,并将其在20多个流行回归问题上的性能与同时学习所有分区的单个模型进行比较。我们的结果显示显著改进,损失降低最高可达54%,确认了该分区算法的实用性。

关键词

引用

@article{arxiv.2411.18254,
  title  = {Active partitioning: inverting the paradigm of active learning},
  author = {Marius Tacke and Matthias Busch and Kevin Linka and Christian J. Cyron and Roland C. Aydin},
  journal= {arXiv preprint arXiv:2411.18254},
  year   = {2025}
}