Ayn:从头预训练的小型且具竞争力的印度法律语言模型
计算与语言
2026-03-17 v3 人工智能
机器学习
摘要
Decoder-only 大型语言模型(LLMs)是目前许多自然语言处理(NLP)应用的首选模型。通过指令微调和提示方法,此类 LLMs 已被有效地用于解决通用和特定领域的任务。然而,它们的训练成本高昂,在某种程度上使用成本也很高,人们可能会想知道 LLMs 是否可以被特定领域的小型语言模型所取代,这些模型通常包含少于 100M 的参数。我们在本研究中解决了这个问题,将一个在特定领域(此处为印度法律领域)使用特定领域分词器从头预训练 185 个 A100 小时的 88M TLM 的性能,与大小在 1B 到 8B 之间的 LLMs 在解决特定领域任务上的性能进行了比较。我们特别表明,我们的法律 TLM Ayn 在法律案件判决预测任务上的表现确实可以优于大至其 80 倍的 LLMs,在摘要任务上与大至其 30 倍的 LLMs 相媲美,并且在通用任务上仍能与这些更大的 LLMs 竞争。
引用
@article{arxiv.2403.13681,
title = {Ayn: A Tiny yet Competitive Indian Legal Language Model Pretrained from Scratch},
author = {Mitodru Niyogi and Eric Gaussier and Arnab Bhattacharya},
journal= {arXiv preprint arXiv:2403.13681},
year = {2026}
}
备注
LREC 2026