中文

PolicyQA:面向隐私政策的阅读理解数据集

计算与语言 2020-10-07 v1

摘要

隐私政策文档冗长繁复。问答(QA)系统可帮助用户查找与其相关且重要的信息。该领域的先前研究将 QA 任务定义为:给定问题,从政策文档中检索最相关的文本段或句子列表。相反,我们认为向用户提供来自政策文档的短文本跨度,可降低其从冗长文本段中搜索目标信息的负担。本文中,我们提出 PolicyQA,一个包含从现有 115 份网站隐私政策语料中整理的 25,017 个阅读理解风格示例的数据集。PolicyQA 提供了为广泛隐私实践编写的 714 个人工标注问题。我们评估了两个现有神经 QA 模型,并进行了严格分析以揭示 PolicyQA 的优势与挑战。

关键词

引用

@article{arxiv.2010.02557,
  title  = {PolicyQA: A Reading Comprehension Dataset for Privacy Policies},
  author = {Wasi Uddin Ahmad and Jianfeng Chi and Yuan Tian and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2010.02557},
  year   = {2020}
}

备注

EMNLP Findings 2020 (short paper)