使用合成数据的对比字符串表示学习
计算与语言
2021-12-22 v2 信息检索
摘要
字符串表示学习(String Representation Learning, SRL)是自然语言处理领域的一项重要任务,但仍未被充分探索。SRL的目标是学习用于编码字符序列的稠密低维向量(或嵌入)。该任务学习到的表示可用于许多下游应用任务,如字符串相似度匹配或词汇归一化。本文中,我们提出一种仅使用合成数据训练SRL模型的新方法。我们的方法利用对比学习(Contrastive Learning)来最大化相关字符串间的相似度,同时最小化不相关字符串间的相似度。我们通过在字符串相似度匹配任务上评估所学表示,证明了方法的有效性。代码、数据与预训练模型将公开可用。
引用
@article{arxiv.2110.04217,
title = {Contrastive String Representation Learning using Synthetic Data},
author = {Urchade Zaratiana},
journal= {arXiv preprint arXiv:2110.04217},
year = {2021}
}
备注
Lack of technical novelty