JTCSE:联合张量模约束与交叉注意力机制的无监督对比学习句子嵌入框架
计算与语言
2025-05-08 v2 人工智能
机器学习
摘要
无监督对比学习已成为自然语言处理领域的研究热点。现有工作通常旨在约束对比学习中正负样本表征在高维语义空间中的方向分布,但语义表征张量同时具有模与方向特征,而现有工作忽略了表征的模特征,导致对比学习不够充分。因此,我们首先提出一个旨在对语义表征张量施加模约束的训练目标,以增强对比学习中正样本之间的对齐。其次,类BERT模型存在注意力沉没现象,导致对聚合语义信息的CLS token关注不足。为此,我们在双塔集成模型之间提出一种交叉注意力结构,以增强模型对CLS token的关注并优化CLS池化的质量。结合上述两个动机,我们提出了一种新的联合张量表征模约束与交叉注意力的无监督对比学习句子嵌入表示框架JTCSE。我们在七个语义文本相似度计算任务上对其进行了评估,实验结果表明,JTCSE的双塔集成模型和单塔蒸馏模型均优于其他基线,成为当前最优(SOTA)。此外,我们进行了广泛的零样本下游任务评估,结果显示JTCSE在超过130个任务上的整体表现优于其他基线。
引用
@article{arxiv.2505.02366,
title = {JTCSE: Joint Tensor-Modulus Constraints and Cross-Attention for Unsupervised Contrastive Learning of Sentence Embeddings},
author = {Tianyu Zong and Hongzhu Yi and Bingkang Shi and Yuanxiang Wang and Jungang Xu},
journal= {arXiv preprint arXiv:2505.02366},
year = {2025}
}