中文

早期退出中的性能控制:以相同计算成本部署大型模型

机器学习 2024-12-30 v1 人工智能

摘要

早期退出(Early Exiting, EE)是一种通过根据数据点的难易性自适应分配计算资源来加速推理的有前景技术。该方法使简单样本可以在更早的层数上退出预测,而为具有挑战性的样本保留更多计算资源。本研究首先提出了一种新的视角,表明在保持类似计算成本的同时,使用早期退出部署的大型模型可实现更高的性能。由于现有方法依赖于每个退出点处的置信度估计,本文进一步研究了过度自信对计算-性能权衡可控性的影响。我们引入了性能控制早期退出(Performance Control Early Exiting, PCEE),一种通过基于持有验证集中与相似置信度水平样本的平均准确率来做出决策,而非数据点置信度的方法,以实现准确率阈值控制。我们在实验中展示,PCEE 提供了一种简单且计算效率更高的方法,可比标准置信度方法更好地控制性能,同时允许我们扩大模型规模以获得性能提升,同时降低计算成本。

关键词

引用

@article{arxiv.2412.19325,
  title  = {Performance Control in Early Exiting to Deploy Large Models at the Same Cost of Smaller Ones},
  author = {Mehrnaz Mofakhami and Reza Bayat and Ioannis Mitliagkas and Joao Monteiro and Valentina Zantedeschi},
  journal= {arXiv preprint arXiv:2412.19325},
  year   = {2024}
}

备注

Appeared at ICML 2024 Workshop on Efficient Systems for Foundation Models (ES-FoMo-II)