通过高效数据集浓缩的经验回放实现设备端学习
机器学习
2024-05-28 v1
摘要
在部署到边缘设备后,模型通常需要进一步从流式数据中学习以提高准确性。然而,从这些数据中提取代表性特征具有挑战性,因为它们通常是无标签的、非独立同分布的,并且仅被看到一次。为了缓解这个问题,一种常见策略是在边缘设备上维护一个小型数据缓冲区,以保存最具代表性的数据用于进一步学习。由于大多数数据要么从未存储,要么被快速丢弃,因此识别最具代表性的数据以避免显著的信息丢失变得至关重要。在本文中,我们提出了一种设备端框架,通过将传入数据浓缩为信息量更大的样本来解决这个问题。具体来说,为了有效处理无标签的传入数据,我们提出了一种专为无标签设备端学习环境设计的伪标签技术。此外,我们开发了一种仅需少量计算资源的数据集浓缩技术。为了抵消浓缩过程中噪声标签的影响,我们进一步利用对比学习目标来提高缓冲区中类别数据的纯度。我们的实证结果表明,与现有方法相比,我们的方法有显著改进,尤其是在缓冲区容量严重受限的情况下。例如,在每类仅有一个样本的缓冲区容量下,我们的方法在CIFAR-10数据集上取得的准确率比最佳现有基线高出58.4%。
引用
@article{arxiv.2405.16113,
title = {Enabling On-Device Learning via Experience Replay with Efficient Dataset Condensation},
author = {Gelei Xu and Ningzhi Tang and Jun Xia and Wei Jin and Yiyu Shi},
journal= {arXiv preprint arXiv:2405.16113},
year = {2024}
}
备注
9 pages, 10 figures