中文

PerPaDa:基于隐式众包数据收集的波斯语复述数据集

计算与语言 2022-09-14 v1 人工智能 机器学习

摘要

本文介绍 PerPaDa,一个从查重系统用户输入中收集的波斯语复述数据集。作为一种隐式众包实践,我们从 Hamtajoo(一个波斯语抄袭检测系统)收集了大量原始与复述句子;在该系统中,用户试图通过复述来隐藏文档中的文本复用情况,并重新提交稿件进行分析。所编数据集包含 2446 个复述实例。为提升所收集数据的整体质量,我们采用了一些启发式规则以排除不符合所提标准的句子。所引入的语料库远大于波斯语复述识别任务已有的数据集。此外,与类似数据集相比,数据偏差更小,因为用户并未遵循某些固定的预定义规则来生成与原始输入相似的文本。

关键词

引用

@article{arxiv.2201.06573,
  title  = {PerPaDa: A Persian Paraphrase Dataset based on Implicit Crowdsourcing Data Collection},
  author = {Salar Mohtaj and Fatemeh Tavakkoli and Habibollah Asghari},
  journal= {arXiv preprint arXiv:2201.06573},
  year   = {2022}
}

备注

Submitted to LREC 2022