LeiBi@COLIEE 2022:将调优词法模型与聚类驱动的基于 BERT 的模型聚合用于判例法检索
信息检索
2022-05-27 v1
摘要
本文总结了我们提交至 2022 年法律信息抽取/蕴涵竞赛(COLIEE)判例法检索任务的方法。我们的方法包含四个步骤;具体而言,给定一个作为查询的法律案件,我们通过抽取各种有意义的句子或 n-gram 对其进行重构。然后,我们利用预处理后的查询案件检索一组初始的可能相关法律文书,并进一步对其重排序。最后,我们将第一阶段与重排序模型获得的相关性分数进行聚合以提升检索效果。在我们方法的每一步中,我们都探索了多种知名与新奇的方法。特别地,为重构查询案件以使其更简短,我们使用三种不同的统计方法(KLI、PLM、IDF-r)以及利用嵌入的模型(如 KeyBERT)来抽取 unigram。此外,我们探究了使用 Longformer-Encoder-Decoder(LED)的自动摘要能否为该检索任务生成有效的查询表示。进而,我们提出了一种新颖的聚类驱动重排序方法,其利用了在大量数据上预调以对查询与候选文档中的句子进行嵌入的 Sentence-BERT 模型。最后,我们采用线性聚合方法将传统 IR 模型与基于神经的模型所获得的相关性分数相结合,旨在融入神经模型的语义理解能力与统计度量的主题相关性。我们表明聚合这些相关性分数能够提升整体检索效果。
引用
@article{arxiv.2205.13351,
title = {LeiBi@COLIEE 2022: Aggregating Tuned Lexical Models with a Cluster-driven BERT-based Model for Case Law Retrieval},
author = {Arian Askari and Georgios Peikos and Gabriella Pasi and Suzan Verberne},
journal= {arXiv preprint arXiv:2205.13351},
year = {2022}
}
备注
Accepted at the COLIEE Workshop in Proceedings of JURISIN 2022. Please cite the published version