用于语义文本相似度的捷克语新闻数据集
计算与语言
2022-01-24 v3 人工智能
机器学习
神经与进化计算
摘要
本文描述了一个由带语义相似度标注的句子组成的新数据集。数据源自捷克语的新闻领域。我们详细描述了收集和标注数据的过程。该数据集包含 138,556 条人工标注,分为训练集与测试集。总计 485 名新闻专业学生参与了创建过程。为提高测试集的可靠性,我们将标注计算为 9 条独立标注的平均值。我们通过测量标注者间与标注者内的协议来评估数据集质量。除协议数值外,我们提供了所收集数据集的详细统计。我们以构建预测句子语义相似度系统的基线实验结束本文。由于海量的训练标注(116,956),该模型表现显著优于平均标注者(Person 相关系数 0.92 对 0.86)。
引用
@article{arxiv.2108.08708,
title = {Czech News Dataset for Semantic Textual Similarity},
author = {Jakub Sido and Michal Seják and Ondřej Pražák and Miloslav Konopík and Václav Moravec},
journal= {arXiv preprint arXiv:2108.08708},
year = {2022}
}