探索面向长尾法律文本分类的选择性检索增强
计算与语言
2025-09-01 v3 信息检索
摘要
法律文本分类是法律领域的基础 NLP 任务。该领域的基准数据集常呈现长尾标签分布,其中许多标签样本不足,导致模型在稀有类别上的表现不佳。本文探索了选择性检索增强(SRA)作为解决此问题的概念验证方法。SRA 聚焦于增强训练集中低频标签的样本,防止对已充分代表的类别引入噪声,且无需修改模型架构。检索仅从训练数据中执行,以确保无潜在信息泄露,无需外部语料库。SRA 在两个具有长尾分布的法律文本分类基准数据集上进行测试:LEDGAR(单标签)和 UNFAIR-ToS(多标签)。结果表明,SRA 在 LexGLUE 基线的 micro-F1 和 macro-F1 指标上均实现了一致的提升。
引用
@article{arxiv.2508.19997,
title = {Exploring Selective Retrieval-Augmentation for Long-Tail Legal Text Classification},
author = {Boheng Mao},
journal= {arXiv preprint arXiv:2508.19997},
year = {2025}
}