通过 Doc2Doc 信息检索实现监管合规:在文本相似性存在局限的欧盟/英国立法中的案例研究
计算与语言
2021-01-27 v1 信息检索
摘要
企业史上的重大丑闻凸显了监管合规的必要性,组织需要确保其控制(流程)符合相关法律、法规和政策。然而,追踪不断变化的立法十分困难,因此组织正越来越多地采用监管科技(RegTech)来简化这一过程。为此,我们引入了监管信息检索(REG-IR),这是文档到文档信息检索(DOC2DOC IR)的一种应用,其中查询为整个文档,使得该任务比查询为短文本的传统 IR 更具挑战性。此外,我们基于欧盟指令与英国立法之间的关系编译并发布了两个数据集。我们使用由预取器和神经重排序器组成的典型两步流水线方法在这些数据集上实验。通过使用从 BM25 到基于若干 BERT 模型表示的 k 近邻的各种预取器进行实验,我们表明在领域内分类任务上微调 BERT 模型可为 IR 生成最佳表示。我们还表明神经重排序器由于相互矛盾的监督(即具有相反标签的相似查询-文档对)而表现不佳,因此它们偏向于预取器的分数。有趣的是,应用日期过滤器进一步提升了性能,展示了时间维度的重要性。
引用
@article{arxiv.2101.10726,
title = {Regulatory Compliance through Doc2Doc Information Retrieval: A case study in EU/UK legislation where text similarity has limitations},
author = {Ilias Chalkidis and Manos Fergadiotis and Nikolaos Manginas and Eva Katakalou and Prodromos Malakasiotis},
journal= {arXiv preprint arXiv:2101.10726},
year = {2021}
}
备注
Accepted for publication by EACL 2021, 13 pages including references and appendices