大规模历史英语语义相似度数据集
计算与语言
2023-08-25 v2 综合经济学
经济学
摘要
多种任务使用基于语义相似度数据训练的语言模型。虽有各类捕捉语义相似度的数据集,但它们或由现代网络数据构建,或是过去十年由人工标注者创建的较小数据集。本研究利用一新来源——来自美国地方报纸、已脱离版权保护的新近数字化文章—— assembled 一个跨越 1920 至 1989 年共 70 年、含近 4 亿正语义相似度对的大规模语义相似度数据集。历史上,美国地方报纸约半数文章来自美联社等新闻专线。地方报纸转载新闻专线文章时,自写标题,构成关联文章的抽取式摘要。我们借助文档版式与语言理解将文章与其标题相关联。随后在存在显著噪声与删节的情况下,使用深度神经方法检测哪些文章源自同一底层来源。被转载文章的标题构成正语义相似度对。所得公开可用的 HEADLINES 数据集显著大于多数现有语义相似度数据集,且覆盖远更长时间跨度。它将促进对比训练语义相似度模型在多种任务中的应用,包括跨时空语义变迁研究。
引用
@article{arxiv.2306.17810,
title = {A Massive Scale Semantic Similarity Dataset of Historical English},
author = {Emily Silcock and Melissa Dell},
journal= {arXiv preprint arXiv:2306.17810},
year = {2023}
}