中文

环保人工智能:释放数据力量实现绿色联邦学习

机器学习 2025-07-24 v1 人工智能 数据库 分布式、并行与集群计算

摘要

人工智能(AI)和机器学习(ML)的广泛采用带来了显著的环境影响,特别是在能源消耗和碳排放方面。这一紧迫问题凸显了创新解决方案以减轻AI生态足迹的必要性。影响ML模型训练能耗的关键因素之一是训练数据集的大小。ML模型通常基于由分布在多个位置的传感器和设备持续生成的海量数据进行训练。为了降低数据传输成本并增强隐私保护,联邦学习(FL)使得无需移动或共享原始数据即可进行模型训练。尽管FL具有这些优势,但由于数据源(在数量和质量方面)的异质性、计算节点能力以及环境影响,它也带来了挑战。本文通过提出一种以数据为中心的绿色联邦学习方法,为绿色AI的发展做出了贡献。具体来说,我们专注于通过最小化训练数据量来减少FL的环境影响。我们的方法包括分析联邦数据集的特征、基于质量指标选择最优数据子集,以及选择环境影响最小的联邦节点。我们开发了一种综合方法,考察了数据质量和数量等以数据为中心的因素对FL训练性能和碳排放的影响。基于这些见解,我们引入了一个交互式推荐系统,通过数据缩减来优化FL配置,从而在训练期间最小化环境影响。将该方法应用于时间序列分类,在减少FL任务的环境影响方面展示了有希望的结果。

关键词

引用

@article{arxiv.2507.17241,
  title  = {Eco-Friendly AI: Unleashing Data Power for Green Federated Learning},
  author = {Mattia Sabella and Monica Vitali},
  journal= {arXiv preprint arXiv:2507.17241},
  year   = {2025}
}