ALPBench:面向表格数据的主动学习管道基准
机器学习
2024-06-26 v1 人工智能
摘要
在只能获得有限标注数据预算的情境下,主动学习旨在制定查询策略,以选择最具信息性的数据点进行标注,以提升学习算法的效率和性能。已提出许多查询策略并进行比较,但社区仍缺乏用于比较不同查询策略性能的标准化基准测试。这在将查询策略与不同学习算法组合成主动学习管道并检查学习算法选择的影响时尤为突出。为弥合这一差距,我们提出了ALPBench,它支持主动学习管道的规格制定、执行和性能监控。它内置了措施以确保评估可重复保存,用于算法的确切数据划分和超参数设置。在总计方面,ALPBench包含86个真实世界的表格分类数据集和5个主动学习设置,产生430个主动学习问题。为演示其有用性和与各种学习算法和查询策略的广泛兼容性,我们进行了一个示例研究,在2个不同设置下评估了9个查询策略配合8个学习算法。我们在此提供ALPBench:https://github.com/ValentinMargraf/ActiveLearningPipelines
引用
@article{arxiv.2406.17322,
title = {ALPBench: A Benchmark for Active Learning Pipelines on Tabular Data},
author = {Valentin Margraf and Marcel Wever and Sandra Gilhuber and Gabriel Marques Tavares and Thomas Seidl and Eyke Hüllermeier},
journal= {arXiv preprint arXiv:2406.17322},
year = {2024}
}