用于隐私政策问答的检索增强数据增广
计算与语言
2023-04-25 v3
摘要
隐私政策的先前研究将问答(QA)任务定义为:给定用户查询,从政策文档中识别最相关的文本段或句子列表。现有的标注数据集严重不平衡(仅有少量相关段),限制了该领域的 QA 性能。在本文中,我们开发了一个基于检索模型集成的的数据增广框架,该框架从未标注的政策文档中捕获相关文本段,并扩充训练集中的正例。此外,为提高增广数据的多样性和质量,我们利用多个预训练语言模型(LMs)并将其与降噪过滤模型级联。在 PrivacyQA 基准上使用我们的增广数据,我们将现有基线大幅提升(10% F1),并实现了 50% 的新的最先进 F1 分数。我们的消融研究进一步提供了关于我们方法有效性的见解。
引用
@article{arxiv.2204.08952,
title = {Retrieval Enhanced Data Augmentation for Question Answering on Privacy Policies},
author = {Md Rizwan Parvez and Jianfeng Chi and Wasi Uddin Ahmad and Yuan Tian and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2204.08952},
year = {2023}
}
备注
EACL 2023