中文

Igea:面向意大利语生物医学文本生成的仅解码器语言模型

计算与语言 2024-07-09 v1 人工智能

摘要

领域特定语言模型的发展显著推进了各个专业领域(尤其是生物医学)的自然语言处理应用。然而,研究重点主要放在英语模型上,为意大利语等资源较少的语言留下了空白。本文介绍了Igea,这是首个专为意大利语生物医学文本生成设计的仅解码器语言模型。Igea基于Minerva模型构建,并在意大利语医学文本的多样化语料库上进行了持续预训练,提供三种模型规模:3.5亿、10亿和30亿参数。这些模型旨在平衡计算效率与性能,应对处理意大利语医学术语特殊性的挑战。我们使用领域内生物医学语料库和通用基准测试的组合来评估Igea,突显了其有效性以及即使在领域特定训练后仍能保留通用知识的能力。本文讨论了模型的开发与评估,为意大利语生物医学NLP的未来进展奠定了基础。

关键词

引用

@article{arxiv.2407.06011,
  title  = {Igea: a Decoder-Only Language Model for Biomedical Text Generation in Italian},
  author = {Tommaso Mario Buonocore and Simone Rancati and Enea Parimbelli},
  journal= {arXiv preprint arXiv:2407.06011},
  year   = {2024}
}

备注

6 pages, 1 figure, 3 tables