ReLeVAnT: 面向准确法律文本分类的相关性词汇向量
计算与语言
2026-04-27 v1 人工智能
摘要
从非结构化数据语料库对法律文件进行分类在下游任务中具有多个关键应用。与法院文件相关的文档在诸如起草动作、备忘录和提纲,以及任务如案件概述、检索系统和训练数据 curated 中至关重要。当前方法基于提供的元数据、LLM 提取的元数据或多模态方法进行分类。这些方法依赖结构化数据、元数据和大量计算资源。本任务从利用类之间判别性特征的角度进行方法论探讨。作者提出了 ReLeVAnT,一个用于法律文件二分类框架。ReLeVAnT 利用 n-gram 处理、对比得分匹配和浅层神经网络作为判别分类的主要驱动力。它利用语料库中每一次的关键词提取,随后使用浅层分类器对文档进行快速可靠的分类,在 LexGLUE 数据集上实现 99.3% 的准确率和 98.7% 的 F1 分数。
引用
@article{arxiv.2604.22292,
title = {ReLeVAnT: Relevance Lexical Vectors for Accurate Legal Text Classification},
author = {Ishaan Gakhar and Harsh Nandwani},
journal= {arXiv preprint arXiv:2604.22292},
year = {2026}
}
备注
9 Pages, 2 figures