面向法律问答的三阶段框架:预训练、微调与重排序
计算与语言
2024-12-30 v1
摘要
法律问答 (QA) 吸引了寻求法律建议的人的注意力,其旨在从大规模问答对数据库中检索出最适用的答案。以往的方法主要使用双编码器架构来学习问题和答案的稠密表示。然而,这些方法可能存在域知识不足和标记训练数据不足的问题。本文提出了一个面向法律问答的三阶段 (pre-training、fine-tuning 和 re-ranking) 框架 (称为 PFR-LQA),以促进细粒度文本表示学习并通过双编码器架构提升稠密检索性能。具体而言,我们首先通过自监督训练目标对法律问题和答案进行领域特定的预训练,使预训练模型适应法律领域。然后,我们在法律问答对上使用监督学习目标进行任务特定的微调双编码器,从而为特定的下游 QA 任务构建高质量的双编码器。最后,我们采用上下文重排序目标进一步细化由文档编码器产生的查询表示,该重排序使用上下文相似性以增加锚查和硬负样本之间的差异,以实现更好的问答排序。我们在手动标注的法律 QA 数据集上进行了大量实验。实验结果表明,我们的 PFR-LQA 方法在法律问答方面优于强大的竞争方法。
引用
@article{arxiv.2412.19482,
title = {Pre-training, Fine-tuning and Re-ranking: A Three-Stage Framework for Legal Question Answering},
author = {Shiwen Ni and Hao Cheng and Min Yang},
journal= {arXiv preprint arXiv:2412.19482},
year = {2024}
}