中文

一句句子值 128 个伪词:面向句子嵌入的语义感知对比学习框架

计算与语言 2022-03-14 v1

摘要

对比学习在无监督句子嵌入任务中已展现出巨大潜力,例如 SimCSE。然而,我们发现这些现有方案深受句子长度或句法结构等表层特征的影响。本文提出一种面向句子嵌入的语义感知对比学习框架,称为伪词 BERT(Pseudo-Token BERT,PT-BERT),其能够利用句子的伪词空间(即潜在语义空间)表示,同时消除句子长度与句法等表层特征的影响。具体而言,我们引入一个独立于 BERT 编码器的额外伪词嵌入层,将每个句子映射为定长的伪词序列。借助这些伪序列,我们能够基于注意力机制构造等长的正例与负例对以执行对比学习。此外,我们利用梯度更新与动量更新两种编码器对样本进行编码,并动态维护一个额外队列以存储句子嵌入的表示,从而增强编码器对负样本的学习性能。实验表明,我们的模型在六项标准语义文本相似度(STS)任务上优于最先进的基线方法。进一步地,关于对齐与均匀性损失以及具有不同句子长度与句法的困难样本的实验,一致验证了方法的有效性。

关键词

引用

@article{arxiv.2203.05877,
  title  = {A Sentence is Worth 128 Pseudo Tokens: A Semantic-Aware Contrastive Learning Framework for Sentence Embeddings},
  author = {Haochen Tan and Wei Shao and Han Wu and Ke Yang and Linqi Song},
  journal= {arXiv preprint arXiv:2203.05877},
  year   = {2022}
}

备注

Long paper; ACL 2022 (Findings)