中文

具有多出口的DNN中的无监督早退

机器学习 2022-09-21 v1 人工智能 计算与语言

摘要

深度神经网络(DNNs)通常设计为顺序级联的可微块/层,且仅在最后一层连接预测模块。DNNs可在主干网络多处附加预测模块,推理可在中间阶段停止而无需经过所有模块。最后出口点可能提供更好预测误差,但也消耗更多计算资源与延迟。一个在预测误差与代价上均“最优”的出口点是理想的。最优出口点可能依赖于任务的潜在分布,并随任务类型变化。在神经推理中,实例真值可能不可用,各出口点误差率无法估计。因此面临无监督设定下选择最优出口的问题。已有工作在离线有监督设定中解决该问题,假设有足够标注数据估计各出口误差率并调参以提升精度。然而预训练DNN常部署于难以获取大量真值的新域。我们将出口选择建模为无监督在线学习问题,并利用bandit理论识别最优出口。具体地,我们聚焦Elastic BERT这一预训练多出口DNN,证明其“近乎”满足强主导(SD)性质,从而在未知真值标签的在线设定下学习最优出口成为可能。我们提出基于上置信界(UCB)的UEE-UCB算法,在SD性质下可证明获得次线性后悔。因而本方法为多出口DNN中自适应学习域特定最优出口点提供了途径。我们在IMDb与Yelp数据集上实证验证了算法。

关键词

引用

@article{arxiv.2209.09480,
  title  = {Unsupervised Early Exit in DNNs with Multiple Exits},
  author = {Hari Narayan N U and Manjesh K. Hanawal and Avinash Bhardwaj},
  journal= {arXiv preprint arXiv:2209.09480},
  year   = {2022}
}

备注

To be presented at International conference on AI-ML systems