利用Twitter作为弱相似文本对大型语料库来源以学习语义句子嵌入
计算与语言
2021-10-06 v1
摘要
语义句子嵌入通常通过有监督方式构建,最小化标注为语义相似的句子对的嵌入距离。由于大型标注数据集稀少(尤其非英语语言)且昂贵,近期研究聚焦于需要非成对输入句子的无监督方法。我们则提出一种与语言无关的方法,利用Twitter内在的强大关联信号——推文的回复与引用——在无人工努力下构建大型弱相似非正式文本对数据集。我们使用收集的句子对以类三元组结构训练Transformer模型,并在Twitter NLP相似度任务(PIT和TURL)及STSb上测试生成的嵌入。我们还引入了四个从初始推文集合中精心提取的非正式文本句子排序评估基准,证明我们的最佳模型不仅学习了经典语义文本相似度,且在句子对并非精确复述的任务上表现优异。消融研究表明,即便在200万样本下,增加语料规模也对结果有正向影响,暗示更大推文集合仍不包含关于语义相似性的冗余信息。
引用
@article{arxiv.2110.02030,
title = {Exploiting Twitter as Source of Large Corpora of Weakly Similar Pairs for Semantic Sentence Embeddings},
author = {Marco Di Giovanni and Marco Brambilla},
journal= {arXiv preprint arXiv:2110.02030},
year = {2021}
}
备注
9 pages, 3 figures, accepted at EMNLP2021