中文

一种用于句子嵌入域自适应的简单方法

计算与语言 2020-08-31 v1 机器学习

摘要

预训练句子嵌入已被证明对多种NLP任务非常有用。由于训练此类嵌入需要大量数据,它们通常在多种文本数据上训练。针对特定领域的自适应在许多情况下可改善结果,但此类微调通常依赖于具体问题,并存在对用于自适应的数据过度适应的风险。本文提出一种使用孪生架构微调Google的Universal Sentence Encoder(USE)的简单通用方法。我们展示了如何将该方案用于多种数据集,并给出了代表相似问题的不同数据集上的结果。该方案亦与这些数据集上的传统微调进行了比较。作为另一优势,该方案可用于合并具有不同标注的数据集。我们还给出了在所有数据集上并行微调得到的嵌入。

关键词

引用

@article{arxiv.2008.11228,
  title  = {A simple method for domain adaptation of sentence embeddings},
  author = {Anna Kruspe},
  journal= {arXiv preprint arXiv:2008.11228},
  year   = {2020}
}