中文

数十亿参数胜过领域内训练数据:以法律案件蕴涵任务为例

计算与语言 2022-05-31 v1

摘要

近期研究表明,参数规模扩展至数十亿的语言模型(如 GPT-3)在零样本和少样本场景中表现极为出色。在本工作中,我们在 COLIEE 2022 竞赛的法律案件蕴涵任务上实验了零样本模型。我们的实验显示,扩大语言模型的参数数量使我们先前零样本结果的 F1 分数提升了超过 6 个点,表明更强的零样本能力可能是更大规模模型的特征,至少对于该任务如此。我们 30 亿参数的零样本模型在 COLIEE 2021 测试集上优于所有模型(包括集成模型),并在 COLIEE 2022 竞赛中取得单一模型的最佳性能,仅次于由该 30 亿模型本身及其较小版本组成的集成模型。尽管大语言模型带来了挑战,主要源于实时应用中的延迟限制,我们展示了我们的零样本 monoT5-3b 模型作为搜索引擎(包括法律文档)在生产环境中使用的演示。我们的提交代码和系统演示分别可在 https://github.com/neuralmind-ai/coliee 和 https://neuralsearchx.neuralmind.ai 获取。

关键词

引用

@article{arxiv.2205.15172,
  title  = {Billions of Parameters Are Worth More Than In-domain Training Data: A case study in the Legal Case Entailment Task},
  author = {Guilherme Moraes Rosa and Luiz Bonifacio and Vitor Jeronymo and Hugo Abonizio and Roberto Lotufo and Rodrigo Nogueira},
  journal= {arXiv preprint arXiv:2205.15172},
  year   = {2022}
}