中文

蒸馏模型中的对比学习

计算与语言 2024-01-24 v1

摘要

像 BERT 这样的自然语言处理模型可以为下游 NLP 任务提供最先进的词嵌入。然而,这些模型在语义文本相似度上的表现仍有不足,并且可能过于庞大,无法部署为轻量级边缘应用。我们试图基于 SimCSE 论文,将一种合适的对比学习方法应用于从知识蒸馏模型 DistilBERT 改编而来的模型架构,以解决这两个问题。我们最终的轻量级模型 DistilFace 在 STS 任务上的斯皮尔曼相关性平均达到 72.1,比 BERT base 提高了 34.2%。

关键词

引用

@article{arxiv.2401.12472,
  title  = {Contrastive Learning in Distilled Models},
  author = {Valerie Lim and Kai Wen Ng and Kenneth Lim},
  journal= {arXiv preprint arXiv:2401.12472},
  year   = {2024}
}