蒸馏还是标注?紧凑模型的成本高效微调
计算与语言
2023-07-07 v3
摘要
微调大型模型极为有效,然而推理可能昂贵并产生碳排放。知识蒸馏已被证明是降低推理成本的实用方案,但蒸馏过程本身需要大量计算资源。与购买或租用 GPU 来微调再蒸馏大型模型不同,NLP 从业者可能转而将可用预算用于雇佣标注者并手动标注额外的微调数据。本文中,我们研究如何最有效地利用固定预算构建紧凑模型。通过在六个多样任务上的大量实验,我们表明从 T5-XXL(11B)蒸馏至 T5-Small(60M)几乎总比标注更多数据直接训练紧凑模型(T5-Small)更具成本效率。我们进一步研究跨场景时分配至计算的最优预算如何变化。我们将发布代码、数据集、标注成本估计与基线模型作为基准,以支持紧凑模型成本高效训练的后续工作。
引用
@article{arxiv.2305.01645,
title = {Distill or Annotate? Cost-Efficient Fine-Tuning of Compact Models},
author = {Junmo Kang and Wei Xu and Alan Ritter},
journal= {arXiv preprint arXiv:2305.01645},
year = {2023}
}
备注
Accepted at ACL 2023 main conference