ViLegalNLI: 用于越南法律文本的自然语言推理
计算与语言
2026-05-04 v1 人工智能
机器学习
摘要
本文介绍了 ViLegalNLI,即首个针对法律领域构建的大规模越南自然语言推理(NLI)数据集。该数据集由 42,012 对前提-假设句对构成,来源于官方法规文件,标注为二元推理标签(蕴涵与非蕴涵)。数据集覆盖多个法律领域,反映具有结构化逻辑、条件从句和领域特定术语的真实法律推理情景。为构建 ViLegalNLI,我们提出了一种半自动数据生成框架,集成大语言模型进行受控假设生成和系统性质量验证程序。该框架包含人工制品缓解策略和跨模型验证,以提高标注可靠性并确保法律一致性。最终得到的数据集捕获了多样化的推理模式,包括改写、逻辑蕴涵和法律无效推理,从而为越南法律推理任务提供了全面的基准。我们对 ViLegalNLI 进行了广泛实验,采用多语言模型、越南专用预训练语言模型和指令调优大语言模型。结果显示,少量样本的 LLM 配置始终实现优异性能,而性能显著受到假设长度、词汇重叠和推理复杂度的影响。跨领域评估进一步揭示了在不同法律领域泛化法律推理的挑战。总体而言,ViLegalNLI 建立了越南法律 NLI 的基础基准,支持法律推理、法规文本理解以及开发可靠用于法律分析和决策支持的人工智能系统的未来研究。该数据集已公开提供供研究使用。
引用
@article{arxiv.2605.00116,
title = {ViLegalNLI: Natural Language Inference for Vietnamese Legal Texts},
author = {Nhung Thi-Hong Duong and Mai Ngoc Ho and Tin Van Huynh and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2605.00116},
year = {2026}
}
备注
33 pages, 17 figures