中文

告别无目标大规模预训练:面向语言模型的影响力子集选择

计算与语言 2023-05-23 v1

摘要

预训练语言模型已在各种自然语言处理任务中取得显著成功。然而,预训练近期转向更大模型与更大数据,导致了巨大的计算与能源成本。本文中,我们提出面向语言模型的影响力子集选择(ISS),其显式利用末端任务知识来选择预训练语料的微小子集。具体而言,ISS 选择那些对末端任务性能提供最正面影响的样本。此外,我们设计了一种基于梯度匹配的影响力估计方法,可大幅降低影响力的计算时间。仅用 0.45% 的数据与低三个数量级的计算成本,ISS 在覆盖四个领域的八个数据集上优于预训练模型(如 RoBERTa)。

关键词

引用

@article{arxiv.2305.12816,
  title  = {Farewell to Aimless Large-scale Pretraining: Influential Subset Selection for Language Model},
  author = {Xiao Wang and Weikang Zhou and Qi Zhang and Jie Zhou and Songyang Gao and Junzhe Wang and Menghan Zhang and Xiang Gao and Yunwen Chen and Tao Gui},
  journal= {arXiv preprint arXiv:2305.12816},
  year   = {2023}
}

备注

Accepted by ACL2023