利用大语言模型缩小监督与无监督句子表示学习间的差距
计算与语言
2023-12-20 v2 机器学习
摘要
句子表示学习(SRL)是自然语言处理(NLP)中的一项基础任务,其中句子嵌入对比学习(CSE)因其优越性能而成为主流技术。CSE 中一个引人注目的现象是监督与无监督方法之间存在显著的性能差距,而它们唯一的区别在于训练数据。先前工作将这一性能差距归因于两种表示性质(对齐性与均匀性)的差异。然而,由于对齐性与均匀性仅衡量结果,它们无法回答“训练数据的哪些方面导致了性能差距?”以及“如何缩小性能差距?”。在本文中,我们进行实证实验来回答这些“什么”与“如何”的问题。我们首先通过彻底比较监督与无监督 CSE 各自训练过程中的行为来回答“什么”问题。从比较中,我们识别出相似度模式作为导致性能差距的关键因素,并引入一个名为相对拟合难度(RFD)的度量来衡量相似度模式的复杂度。接着,基于从“什么”问题中获得的见解,我们通过增加训练数据的模式复杂度来解决“如何”问题。我们利用大语言模型(LLM)的上下文学习(ICL)能力来生成模拟复杂模式的数据。通过利用 LLM 生成数据中的层次化模式,我们有效缩小了监督与无监督 CSE 之间的差距。我们在 https://github.com/BDBC-KG-NLP/NGCSE 发布了我们的代码与附录。
引用
@article{arxiv.2309.06453,
title = {Narrowing the Gap between Supervised and Unsupervised Sentence Representation Learning with Large Language Model},
author = {Mingxin Li and Richong Zhang and Zhijie Nie and Yongyi Mao},
journal= {arXiv preprint arXiv:2309.06453},
year = {2023}
}
备注
Accepted at AAAI24