中文

FOMO:法律电子发现中的主题与文档

信息检索 2021-09-17 v1

摘要

在美国,诉讼当事人须检索其电子存储信息以找出与具体案件相关的文档,并出示给对方。围绕检索范围的协商常反映出一种恐有遗漏的担忧(Fear of Missing Out:FOMO)。例如,80% 的召回率意味着 20% 的相关文档将未被出示。本文主张,电子发现是识别响应性信息而非识别文档的过程。文档是信息的载体,并非该过程的直接目标。给定文档可能包含一个或多个主题或事实片段,而一个事实片段可能出现在多个文档中。优惠券收集问题、Heaps 定律及其他分析提供了对从文档中查找信息建模的方法。然而在电子发现中,当事人并不知道文档集中可能存在多少事实片段或其概率。本文描述了一个简单模型,用于估计某一事实在被产出集(已识别集)中遗漏、却存在于遗漏集中的置信度。随后分析了两个数据集:一个涉及微侵犯的小型集,以及一个涉及网页分类的较大集。两者均表明,在相对少量的文档内即可发现每个可用主题的至少一例,意味着进一步努力不会返回额外的新信息。较小数据集还被用于考察电子发现常用的非随机文档检索顺序(称为连续主动学习)是否影响主题分布——其并未影响。

关键词

引用

@article{arxiv.2109.08059,
  title  = {FOMO: Topics versus documents in legal eDiscovery},
  author = {Herbert Roitblat},
  journal= {arXiv preprint arXiv:2109.08059},
  year   = {2021}
}