中文

2022年RuATD俄语人工文本检测共享任务发现

计算与语言 2023-10-04 v1

摘要

我们介绍作为2022年Dialogue Evaluation倡议一部分组织的俄语人工文本检测共享任务。共享任务数据集包含来自14个文本生成器的文本,即一名人类写作者以及为以下一项或多项生成任务微调的13个文本生成模型:机器翻译、释义生成、文本摘要、文本简化。我们还考虑了回译与零样本生成方法。人类书写文本采集自多个领域的公开可用资源。共享任务包含两个子任务:(i)判定给定文本是自动生成还是人类书写;(ii)识别给定文本的作者是谁。第一个任务被构建为二分类问题,第二个任务是多分类问题。我们提供了基于计数与基于BERT的基线,以及对第一子任务的人工评估。分别有总计30个和8个系统提交至二分类与多分类子任务。多数团队大幅超越基线。我们在GitHub仓库(https://github.com/dialogue-evaluation/RuATD)公开发布代码库、人工评估结果及其他材料。

关键词

引用

@article{arxiv.2206.01583,
  title  = {Findings of the The RuATD Shared Task 2022 on Artificial Text Detection in Russian},
  author = {Tatiana Shamardina and Vladislav Mikhailov and Daniil Chernianskii and Alena Fenogenova and Marat Saidov and Anastasiya Valeeva and Tatiana Shavrina and Ivan Smurov and Elena Tutubalina and Ekaterina Artemova},
  journal= {arXiv preprint arXiv:2206.01583},
  year   = {2023}
}

备注

Accepted to Dialogue-22