从自动挖掘的复述句对训练高效的神经句子编码器
计算与语言
2022-07-27 v1
摘要
句子嵌入常用于文本聚类与语义检索任务。最先进的句子表示方法基于在大量人工标注句子对上微调的人工神经网络。对于英语或中文等高资源语言,已有充足的标注数据。在较冷门的语言中,必须使用多语言模型,其性能较低。在本文中,我们提出一种无需人工标注数据即可训练高效特定语言句子编码器的方法,以解决该问题。我们的方法是从句子对齐的双语文本语料库自动构建复述句对数据集。随后我们使用所收集的数据,配合额外的循环池化层微调 Transformer 语言模型。我们的句子编码器可在单块显卡上不到一天完成训练,在多种句子级任务上取得高性能。我们在波兰语的八项语言任务上评估了该方法,并与现有最佳多语言句子编码器进行比较。
引用
@article{arxiv.2207.12759,
title = {Training Effective Neural Sentence Encoders from Automatically Mined Paraphrases},
author = {Sławomir Dadas},
journal= {arXiv preprint arXiv:2207.12759},
year = {2022}
}