基于合成数据识别的句子相似度重加权策略
计算与语言
2022-08-31 v2
摘要
语义上有意义的句子嵌入对自然语言处理中的众多任务十分重要。为获得此类嵌入,近期研究探索了利用预训练语言模型(PLMs)合成生成的数据作为训练语料的思想。然而,PLMs 生成的句子常与人类书写的句子差异很大。我们假设,在训练深度神经网络时平等对待所有此类合成样本,会对学习语义上有意义的嵌入产生不利影响。为分析这一点,我们首先训练一个识别机器撰写句子的分类器,并观察到被识别为机器书写的句子之语言特征与人类书写句子显著不同。基于此,我们提出一种新方法:先训练分类器以衡量每个句子的重要性,然后将从分类器提炼的信息用于训练可靠的句子嵌入模型。通过在四个真实世界数据集上的广泛评估,我们证明了我们的模型在合成数据上训练后具有良好的泛化性,并优于现有基线。我们的实现公开于 https://github.com/ddehun/coling2022_reweighting_sts。
引用
@article{arxiv.2208.13376,
title = {Reweighting Strategy based on Synthetic Data Identification for Sentence Similarity},
author = {Taehee Kim and ChaeHun Park and Jimin Hong and Radhika Dua and Edward Choi and Jaegul Choo},
journal= {arXiv preprint arXiv:2208.13376},
year = {2022}
}
备注
COLING2022