数据集增长
机器学习
2024-07-24 v2
摘要
深度学习受益于可用数据的不断增长。同时,高效应对日益扩大的数据规模已成为挑战。公开的数据来自不同来源,质量各异,鉴于当下数据规模,手动清理噪声和冗余数据已不可行。已有技术可用于清洁/选择收集的数据。然而,这些方法主要针对离线环境,旨在解决干净度或冗余度问题。实际中,数据以指数级增长,两者并存,导致对数据清洗的重复操作且效率 suboptimal。为解决这一挑战,我们提出了 InfoGrowth——一种高效的在线算法,用于数据清洁和选择,生成不断增长且保持最新状态的数据集,同时意识到干净度和多样性。InfoGrowth 在单模态和多模态任务上均可提升数据质量/效率,具有高效可扩展的设计。其框架使其可用于实际数据引擎。
引用
@article{arxiv.2405.18347,
title = {Dataset Growth},
author = {Ziheng Qin and Zhaopan Xu and Yukun Zhou and Zangwei Zheng and Zebang Cheng and Hao Tang and Lei Shang and Baigui Sun and Xiaojiang Peng and Radu Timofte and Hongxun Yao and Kai Wang and Yang You},
journal= {arXiv preprint arXiv:2405.18347},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2305.20087 by other authors