中文

AdapSNE:基于火焰算法优化和熵导向的数据集自适应采样用于边缘DNN训练

机器学习 2025-08-26 v1

摘要

直接在边缘设备上训练深度神经网络(DNN)正受到越来越多的关注,因为它为解决域适应和隐私保留等挑战提供了有前景的解决方案。然而,传统的DNN训练通常需要大规模数据集,这对边缘设备尤其是新兴大型语言模型(LLM)任务提出了巨大的负担。为此,已引入一种无DNN方法(即,无DNN的数据集采样),称为NMS(近内存采样)。该方法首先对数据集进行降维,然后在降简空间中进行样本采样,避免了DNN方法中固有的建构偏见,从而实现更好的泛化。然而,最先进的NMS存在两个局限性:(1)搜索方法与每plexity误函数的非单调性特性之间的不匹配导致在降简表示中出现异常值;(2)关键参数(即,目标每plexity)被经验性地选择,引入任意性并导致采样不均。这两个问题导致样本代表性偏差,造成准确率下降。为此,我们提出AdapSNE,集成一种高效的非单调搜索方法——火焰算法(Fireworks Algorithm, FWA)以抑制异常值,并采用熵导向优化以实现均匀采样,从而确保代表性训练样本并提升训练准确率。为降低FWA搜索和熵导向优化迭代计算在边缘端的成本,我们设计了一个具有自定义数据流和时分复用的数据加速器,显著降低了设备端训练的能耗和面积。

关键词

引用

@article{arxiv.2508.16647,
  title  = {AdapSNE: Adaptive Fireworks-Optimized and Entropy-Guided Dataset Sampling for Edge DNN Training},
  author = {Boran Zhao and Hetian Liu and Zihang Yuan and Li Zhu and Fan Yang and Lina Xie Tian Xia and Wenzhe Zhao and Pengju Ren},
  journal= {arXiv preprint arXiv:2508.16647},
  year   = {2025}
}