中文

LawngNLI:用于从短到长上下文的域内泛化及基于蕴含的检索的长前提基准

计算与语言 2022-12-07 v1

摘要

自然语言推理已趋向于研究句子层级之外的上下文。一个重要应用领域是法律:过往案例往往不能预示其如何适用于新情形,必须推断其蕴含。本文介绍了 LawngNLI,其由美国法律意见构建,带有高人工验证准确率的自动标签。前提长且多粒度。实验展示了两个用例。首先,LawngNLI 可基准测试从短到长上下文的域内泛化。大规模长前提 NLI 数据集是否真正需要构建一直不明:在长前提上接近顶级的性能可能通过用短前提微调即可达到。若无多粒度,基准无法区分在长前提上缺乏微调与短长数据集间的领域偏移。相反,我们的长短前提共享相同样例与领域。使用若干过往 NLI 数据集和/或我们的短前提微调的模型在我们的长前提上未达顶级性能。因此至少对某些领域(如我们的),大规模长前提数据集是必需的。其次,LawngNLI 可基准测试基于蕴含的检索。查询被目标文档蕴含或矛盾,允许用户游走于论点与证据之间。领先的检索模型在衍生自 LawngNLI 的检索任务上零样本表现合理。我们比较了不同的重排序系统,包括词法重叠和使用改良 LawngNLI 或过往 NLI 数据集微调的跨编码器。LawngNLI 可训练和测试用于基于蕴含的判例检索与论证的系统。

关键词

引用

@article{arxiv.2212.03222,
  title  = {LawngNLI: A Long-Premise Benchmark for In-Domain Generalization from Short to Long Contexts and for Implication-Based Retrieval},
  author = {William Bruno and Dan Roth},
  journal= {arXiv preprint arXiv:2212.03222},
  year   = {2022}
}

备注

Findings of EMNLP 2022