中文

西班牙语语言模型评估的经验教训

计算与语言 2023-09-25 v2 人工智能

摘要

鉴于语言模型对自然语言处理领域的冲击,已有若干西班牙语仅编码器掩码语言模型(即 BERTs)被训练并发布。这些模型要么在大型项目中利用超大规模私有语料库开发,要么通过利用免费可用数据的较小规模学术努力开发。本文我们对西班牙语语言模型进行了全面的头对头比较,得出以下结果:(i)先前被忽视的大型公司的多语言模型表现优于单语模型,大幅改变了西班牙语语言模型的评估格局;(ii)单语模型间的结果并不确定,一些 supposedly 更小且更差的模型具有竞争力。基于这些实证结果,我们主张需要更多研究以理解其背后的因素。就此而言,语料库规模、质量和预训练技术的影响需要进一步调查,以便能够获得显著优于大型私有公司发布的多语言模型的西班牙语单语模型,尤其是在该领域快速持续进展的背景下。近期西班牙语语言技术开发活动值得欢迎,但我们的结果表明构建语言模型仍是一个开放的、资源密集型问题,需要将资源(资金和/或计算)与最佳研究专长与实践相结合。

关键词

引用

@article{arxiv.2212.08390,
  title  = {Lessons learned from the evaluation of Spanish Language Models},
  author = {Rodrigo Agerri and Eneko Agirre},
  journal= {arXiv preprint arXiv:2212.08390},
  year   = {2023}
}

备注

11 pages, three tables