中文

基于信息瓶颈原理的文本表示蒸馏

计算与语言 2023-11-10 v1 人工智能

摘要

预训练语言模型(PLMs)近来在文本表示领域取得了巨大成功。然而,PLMs的高计算成本和高维表示给实际应用带来了重大挑战。为使模型更易使用,一种有效方法是将大型模型蒸馏为更小的表示模型。为缓解蒸馏后性能下降的问题,我们提出了一种称为IBKD的新型知识蒸馏方法。该方法受信息瓶颈原理启发,旨在最大化教师模型与学生模型最终表示之间的互信息,同时减少学生模型表示与输入数据之间的互信息。这使学生在保留重要已学信息的同时避免不必要信息,从而降低过拟合风险。在两个文本表示主要下游应用(语义文本相似度与稠密检索任务)上的实证研究表明了我们提出方法的有效性。

关键词

引用

@article{arxiv.2311.05472,
  title  = {Text Representation Distillation via Information Bottleneck Principle},
  author = {Yanzhao Zhang and Dingkun Long and Zehan Li and Pengjun Xie},
  journal= {arXiv preprint arXiv:2311.05472},
  year   = {2023}
}

备注

Accepted to EMNLP 2023. The code and pre-trained models are available at [this https URL](https://github.com/Alibaba-NLP/IBKD)