利用少样本示例自动生成训练数据改进句子嵌入
计算与语言
2024-08-05 v2 机器学习
摘要
基于解码器的大语言模型(LLMs)在自然语言处理的许多任务上表现出高性能。句子嵌入学习也是如此,基于解码器的模型PromptEOL在语义文本相似度(STS)任务上取得了最佳性能。然而,PromptEOL需要手动标注的自然语言推理(NLI)数据集进行微调。我们的目标是无需使用大型手动标注数据集来改进句子嵌入,通过使用LLM自动生成NLI数据集并将其用于PromptEOL的微调。为此,在本研究中我们探索了适合句子嵌入学习的数据生成方法。具体而言,我们将关注通过少样本学习自动生成数据集,并探索利用少样本示例的适当方法。在STS任务上的实验结果表明,在没有大型手动标注数据集的设置下,我们的方法优于现有模型。
引用
@article{arxiv.2402.15132,
title = {Improving Sentence Embeddings with Automatic Generation of Training Data Using Few-shot Examples},
author = {Soma Sato and Hayato Tsukagoshi and Ryohei Sasano and Koichi Takeda},
journal= {arXiv preprint arXiv:2402.15132},
year = {2024}
}