中文

如何无需暴力微调确定最强预训练语言模型?一项实证综述

计算与语言 2023-12-11 v1

摘要

可迁移性估计在计算机视觉领域备受关注。研究者试图以低计算成本估计模型从源任务迁移到给定目标任务时的性能。鉴于此类估计的有效性,自然语言处理社区也开始研究类似问题以用于预训练语言模型的选择。然而,目前尚缺乏对这些估计方法的全面比较。此外,视觉与语言场景之间的差异使得先前结论能否跨领域成立存疑。本文首先对现有能够找到最合适模型的可迁移性估计方法进行了全面综述,随后基于 GLUE 基准对所综述的方法进行了详细的实证研究。通过定性与定量分析,我们展示了现有方法的优势与不足,并表明 H-Score 通常在有效性和效率方面表现优越。我们还概述了考虑训练细节、适用于文本生成以及与特定指标一致性方面的困难,为未来方向提供了启示。

关键词

引用

@article{arxiv.2312.04775,
  title  = {How to Determine the Most Powerful Pre-trained Language Model without Brute Force Fine-tuning? An Empirical Survey},
  author = {Jun Bai and Xiaofeng Zhang and Chen Li and Hanhua Hong and Xi Xu and Chenghua Lin and Wenge Rong},
  journal= {arXiv preprint arXiv:2312.04775},
  year   = {2023}
}

备注

Accepted by Findings of EMNLP 2023