无监督硬负样本增强用于对比学习
计算与语言
2024-01-08 v1
摘要
我们提出了无监督硬负样本增强(UNA),一种基于词频-逆文档频率(TF-IDF)检索模型生成合成负样本的方法。UNA使用TF-IDF分数确定句子中词语的重要性,然后通过替换词语来生成负样本。实验表明,使用UNA训练的模型在语义文本相似性任务上提升了整体性能。当UNA与释义增强结合时,获得了额外的性能提升。进一步的结果显示,我们的方法与不同的骨干模型兼容。消融研究也支持使用TF-IDF驱动的负样本增强控制。
引用
@article{arxiv.2401.02594,
title = {Unsupervised hard Negative Augmentation for contrastive learning},
author = {Yuxuan Shu and Vasileios Lampos},
journal= {arXiv preprint arXiv:2401.02594},
year = {2024}
}
备注
The code and pre-trained models are available at https://github.com/ClaudiaShu/UNA