中文

ModernBERT在日本放射学报告中的胸部CT发现分类中比传统BERT更高效

计算与语言 2025-11-25 v2

摘要

用于医学文本分类的日语语言模型在放射学报告的复杂词汇和语言结构方面面临挑战。本研究比较了三种日语模型——BERT Base、JMedRoBERTa 和 ModernBERT——对 18 种胸部 CT 发现的多元标签分类。使用 CT-RATE-JPN 数据集,所有模型均在相同条件下进行了微调。ModernBERT 表现出明显的效率优势,产生的标记显著少于其他模型,训练和推理速度更快,同时在内部测试数据集上保持了可比的性能(精确匹配准确率:74.7% 对比 BERT Base 的 72.7%)。为了评估泛化能力,我们另外构建了 RR-Findings,这是一个包含 243 份自然书写的日语放射学报告的外部数据集,使用相同的模式进行标注。在这一领域偏移的设置下,性能差异变得显著:BERT Base 优于 JMedRoBERTa 和 ModernBERT,而 ModernBERT 在精确匹配准确率上下降幅度最大。平均精度差异较小,表明 ModernBERT 尽管校准度降低,但仍保留了合理的排序能力。总体而言,ModernBERT 提供了显著的计算效率和强大的领域内性能,但仍然对现实世界语言变异性敏感。这些结果强调了在异质临床环境中部署现代Transformer模型时,需要更多样化的自然语言训练数据和领域特定的校准策略以提高鲁棒性。

关键词

引用

@article{arxiv.2503.05060,
  title  = {ModernBERT is More Efficient than Conventional BERT for Chest CT Findings Classification in Japanese Radiology Reports},
  author = {Yosuke Yamagishi and Tomohiro Kikuchi and Shouhei Hanaoka and Takeharu Yoshikawa and Osamu Abe},
  journal= {arXiv preprint arXiv:2503.05060},
  year   = {2025}
}

备注

31 pages