中文

可持续性非线性:量化移动设备上人工智能性能、能源和隐私的权衡

软件工程 2026-05-21 v2 人工智能 机器学习

摘要

将大型语言模型(LLM)从云集群迁移到边缘设备虽 promise 提升隐私和离线可访问性,但这一过渡遇到严酷现实:移动设备的物理限制——包括电池容量、热限制以及最重要的内存限制。为驾驭这一landscape,我们构建了一个可复制可再现的实验管道,用于描绘人工智能能源消耗、延迟和质量之间的复杂相互作用。我们利用该管道对旗舰Android设备进行实证案例研究,捕获八个不同参数量(0.5B至9B)的LLM的细粒度指标,而无需root访问,确保我们的发现反映真实用户条件。研究结果揭示了生成质量、性能、能源和资源消耗之间的权衡,揭示了在不同条件下哪些LLM在各项指标之间提供最佳平衡。此外,我们发现了一个反直觉的量化能源悖论:尽管现代重要感知量化成功降低了内存占用以适配更大的模型至RAM,但我们发现其能源节省效果微乎其微,与标准混合精度方法相比。这表明,对于电池续航而言,模型的体系结构而非其量化方案是决定性因素。我们进一步识别到,混合专家(MoE)架构违背了标准的大小-能源趋势,能够提供7B模型的存储容量,同时保持1B至2B模型的低能源配置。最后,对这些多目标权衡的分析揭示了中等参数规模模型(如Qwen2.5-3B)在有效平衡响应质量与可持续能源消耗方面的务实的sweet spot。

关键词

引用

@article{arxiv.2603.26603,
  title  = {Sustainability Is Not Linear: Quantifying Performance, Energy, and Privacy Trade-offs in On-Device Intelligence},
  author = {Eziyo Ehsani and Luca Giamattei and Ivano Malavolta and Roberto Pietrantuono},
  journal= {arXiv preprint arXiv:2603.26603},
  year   = {2026}
}

备注

Under review at Empirical Software Engineering (EMSE)