面向边缘设备的数据高效训练的两阶段数据选择框架
机器学习
2025-06-11 v2
摘要
由于数据隐私和个性化服务需求的不断增加,边缘设备上的机器学习模型训练需求日益增长。然而,我们注意到,当前的设备内模型训练因训练吞吐量低、存储受限以及数据重要性多样化,导致设备内数据的充分利用不足。为提高数据资源的利用率,我们提出了一种名为{\sf Titan}的两阶段数据选择框架,用于从流式数据中选择具有保证效率和效果的最重要数据批次进行模型训练。具体而言,在第一阶段,{\sf Titan}以粗粒度方式筛选出可能具有高重要性的候选数据集。在第二阶段进行细粒度选择,我们提出了一种理论上最优的数据选择策略,以识别对当前训练轮次具有最高模型性能提升的数据批次。为了进一步提高时间和资源的效率,{\sf Titan}采用管道方式协同执行数据选择和模型训练,通过利用空闲计算资源来避免资源冲突。我们在真实的边缘设备上对{\sf Titan}进行了评估,并在三个具有代表性的边缘计算任务上进行测试,这些任务涉及多样化的模型和数据模态。实证结果表明,{\sf Titan}在训练时间上可实现最高43%的减少,在最终准确率上可实现6.2%的提升,仅引入极少的系统开销,如数据处理延迟、内存占用和能源消耗。
引用
@article{arxiv.2505.16563,
title = {A Two-Stage Data Selection Framework for Data-Efficient Model Training on Edge Devices},
author = {Chen Gong and Rui Xing and Zhenzhe Zheng and Fan Wu},
journal= {arXiv preprint arXiv:2505.16563},
year = {2025}
}