中文

一种日语语言模型与三项新的药学自然语言处理评估基准

计算与语言 2025-09-10 v2

摘要

我们 presented 一种面向药学领域的日语特定语言模型,通过在20亿日语药学token和80亿英文医学token上的持续预训练开发。为实现严格评估,我们引入了三个新的评估基准:YakugakuQA基于全国药师执业考试;NayoseQA测试跨语言同义词和术语规范化;SogoCheck是一种新任务,用于评估成对陈述间的一致性推理。我们对模型进行评估,比较了开源医学大语言模型和商业模型,包括GPT-4o。结果表明,我们的特定领域模型在现有开源模型中表现更佳,在与商业模型中保持竞争力,尤其在术语密集型和知识密集型任务上。有趣的是,GPT-4o在SogoCheck上表现不佳,这表明跨句子一致性推理仍是一个开放性挑战。我们的基准套组为药学自然语言处理提供了更广泛的诊断视角,涵盖事实记忆、词汇变化和逻辑一致性。这一工作证明了构建实用、安全且成本效益高的日语特定领域语言模型的可行性,并为未来药学和医疗保健自然语言处理研究提供了可重用的评估资源。我们的模型、代码和数据集已发布于https://github.com/EQUES-Inc/pharma-LLM-eval。

关键词

引用

@article{arxiv.2505.16661,
  title  = {A Japanese Language Model and Three New Evaluation Benchmarks for Pharmaceutical NLP},
  author = {Shinnosuke Ono and Issey Sukeda and Takuro Fujii and Kosei Buma and Shunsuke Sasaki},
  journal= {arXiv preprint arXiv:2505.16661},
  year   = {2025}
}

备注

15 pages, 9 tables, 5 figures