面向异构长尾学习:基准、指标与工具箱
机器学习
2024-10-31 v2
摘要
长尾数据分布在电子商务、金融、生物医学和网络安全等诸多领域带来挑战,机器学习模型性能往往由头部类别主导,而尾部类别学习不充分。本工作旨在从三个关键角度系统审视长尾学习:(A1)数据长尾性的刻画,(A2)不同领域的数据复杂性,以及(A3)新兴任务的异构性。我们开发了HeroLT,一个综合长尾学习基准,集成了18种最先进算法、10项评估指标以及跨越6项任务和4种数据模态的17个真实世界数据集。HeroLT以新颖的角度和大量实验(共计315个)实现了在多种数据集类型上对新方法与现有基线进行有效且公平的评估。最后,我们总结并强调了长尾学习的重要应用,并指出若干有前景的未来方向。为便于获取与复现,我们在 https://github.com/SSSKJ/HeroLT 开源了基准HeroLT及相应结果。
引用
@article{arxiv.2307.08235,
title = {Towards Heterogeneous Long-tailed Learning: Benchmarking, Metrics, and Toolbox},
author = {Haohui Wang and Weijie Guan and Jianpeng Chen and Zi Wang and Dawei Zhou},
journal= {arXiv preprint arXiv:2307.08235},
year = {2024}
}
备注
Accepted at NeurIPS 2024 Datasets and Benchmarks