中文

相关先例案例的无监督识别

信息检索 2021-07-20 v1 计算与语言

摘要

文档检索几乎在知识理解的所有领域(包括法律领域)中都已发挥作用。先例是指被视为裁决涉及相同或相似事实或相似法律问题的后续案件之权威的法院判决。在本工作中,我们提出不同的无监督方法来解决识别给定查询案例相关先例的任务。我们提出的方法使用 word2vec、doc2vec 和 sent2vec 等词嵌入,使用 TF-IDF 求余弦相似度,使用 BM25 分数检索相关文档,使用预训练模型和 SBERT 寻找最相似文档,以及使用 BM25 与 TF-IDF 分数的乘积为给定查询寻找最相关文档。我们基于 precision@10、recall@10 和 MRR 对所有方法进行了比较。基于对比分析,我们发现 TF-IDF 分数乘以 BM25 分数给出最佳结果。本文还给出了为改进 BM25 分数所做的分析。

关键词

引用

@article{arxiv.2107.08973,
  title  = {Unsupervised Identification of Relevant Prior Cases},
  author = {Shivangi Bithel and Sumitra S Malagi},
  journal= {arXiv preprint arXiv:2107.08973},
  year   = {2021}
}

备注

Code: https://github.com/shivangibithel/Information-Retrieval-CS6370