西班牙生物医学爬取语料库:一个大规模、多样化的西班牙语生物医学语言模型数据集
计算与语言
2021-09-17 v1
摘要
我们介绍 CoWeSe(Corpus Web Salud Español,西班牙健康网络语料库),迄今最大的西班牙语生物医学语料库,包含 4.5GB(约 7.5 亿词符)的干净纯文本。CoWeSe 是 2020 年对 3000 个西班牙语域名执行大规模爬虫的结果。该语料库公开可用且已预处理。CoWeSe 是西班牙语生物医学与健康自然语言处理的重要资源,并已被用于训练特定领域语言模型及生成词嵌入。我们以知识共享署名 4.0 国际许可协议发布 CoWeSe 语料库,发布于 Zenodo(\url{https://zenodo.org/record/4561971\#.YTI5SnVKiEA})。
引用
@article{arxiv.2109.07765,
title = {Spanish Biomedical Crawled Corpus: A Large, Diverse Dataset for Spanish Biomedical Language Models},
author = {Casimiro Pio Carrino and Jordi Armengol-Estapé and Ona de Gibert Bonet and Asier Gutiérrez-Fandiño and Aitor Gonzalez-Agirre and Martin Krallinger and Marta Villegas},
journal= {arXiv preprint arXiv:2109.07765},
year = {2021}
}