中文

CORD19STS: COVID-19 语义文本相似度数据集

计算与语言 2020-11-04 v2

摘要

为抗击 COVID-19 大流行,社会可从各类自然语言处理应用中受益,例如专门针对 COVID-19 校准的对话式医疗诊断系统与信息检索引擎。这些应用依赖于度量语义文本相似度(STS)的能力,使得 STS 成为一项可惠及若干下游应用的基础任务。然而,现有的 STS 数据集与模型未能将其性能迁移到如 COVID-19 这般的特定领域环境中。为弥补这一差距,我们引入了 CORD19STS 数据集,其包含从 COVID-19 开放研究数据集(CORD-19)挑战中收集的 13,710 个标注句子对。具体而言,我们使用不同的采样策略生成了一百万个句子对。随后我们使用一个微调的类似 BERT 的语言模型(称之为 Sen-SCI-CORD19-BERT)来计算句子对之间的相似度分数,以提供针对不同语义相似度水平均衡的数据集,最终得到 32K 个句子对。每个句子对由五名 Amazon Mechanical Turk (AMT) 众包工人标注,标签表示句子对之间的不同语义相似度水平(即相关、部分相关、不相关)。在采用严格的资格任务来验证所收集的标注后,我们最终的 CORD19STS 数据集包含 13,710 个句子对。

关键词

引用

@article{arxiv.2007.02461,
  title  = {CORD19STS: COVID-19 Semantic Textual Similarity Dataset},
  author = {Xiao Guo and Hengameh Mirzaalian and Ekraam Sabir and Ayush Jaiswal and Wael Abd-Almageed},
  journal= {arXiv preprint arXiv:2007.02461},
  year   = {2020}
}