中文

基于期刊影响因子的生物医学领域适应预训练数据选择

计算与语言 2024-09-05 v1

摘要

领域适应是自然语言处理 (NLP) 中常用的方法,用于提高特定领域语言模型的性能。这一方法在生物医学领域尤为常见,该领域不时发布大量科学文章。PubMed 作为生物医学领域的重要文本语料库,经常被用于此。本研究的主要目标是探讨是否可以通过特定科学论文的质量指标来细化预训练数据集,从而提高最终模型的性能。为实现此目标,我们采用两种简单的方法,并通过持续在完整 PubMed 训练集的 various 子集上进行预训练来进行实验,随后在来自 BLURB 基准的生物医学语言理解任务上评估所得模型。我们的结果表明,使用期刊影响因子进行修剪并不够高效。但我们也表明,使用更少的摘要进行预训练(但保持相同的训练步数)并不一定会降低最终模型的性能。

关键词

引用

@article{arxiv.2409.02725,
  title  = {Pre-training data selection for biomedical domain adaptation using journal impact metrics},
  author = {Mathieu Laï-king and Patrick Paroubek},
  journal= {arXiv preprint arXiv:2409.02725},
  year   = {2024}
}