GlobalWasteData:用于健壮废物分类与环境监控的大规模、集成数据集
计算机视觉与模式识别
2026-02-10 v1
摘要
废弃物的不断增加是环境问题的关键,需要高效的分类技术来处理各种类型的废弃物。用于此目的的自动化废弃物分类系统依赖于可用性和质量良好的公共数据集,这些数据集为训练和分析分类算法提供了基础。虽然已存在多个公共废弃物分类数据集,但它们仍然碎片化、不一致且倾向于特定环境。class 名称、注释格式、图像条件和 class 分布差异使得难以合并这些数据集或训练在真实场景中表现良好的模型。为解决这些问题,我们引入GlobalWasteData(GWD)档案,一个包含89,807张覆盖14个主要类别的图像,标注了68个 distinct subclass的大规模数据集。我们通过合并多个公共数据集构建了这个新集成的GWD档案,形成一个统一的资源。该GWD档案提供一致的标签、改进的域多样性和更平衡的 class 表示,使开发健壮且可泛化的废弃物识别模型成为可能。额外的预处理步骤,如质量筛选、重复项删除和 metadata 生成进一步提高了数据集的可靠性。总体而言,该数据集为机器学习在环境监控、回收自动化和废弃物识别中的应用提供了坚实基础,并且向公众开放,以推动未来研究和可重复性。
引用
@article{arxiv.2602.07463,
title = {GlobalWasteData: A Large-Scale, Integrated Dataset for Robust Waste Classification and Environmental Monitoring},
author = {Misbah Ijaz and Saif Ur Rehman Khan and Abd Ur Rehman and Tayyaba Asif and Sebastian Vollmer and Andreas Dengel and Muhammad Nabeel Asim},
journal= {arXiv preprint arXiv:2602.07463},
year = {2026}
}