中文

面向日语胸部CT报告的大规模数据集开发与高性能 finding 分类模型

概率论 2025-04-11 v2

摘要

背景:近期大语言模型的进步凸显了高质量多语言医学数据集的需求。尽管日本在全球CT扫描仪器件部署和使用方面处于领先位置,但缺乏大规模的日语放射学数据集阻碍了针对医学影像分析开发专业语言模型。目标:开发覆盖面的日语CT报告数据集,建立专用的语言模型用于结构化 finding 分类。同时,制定严格经验证的评估数据集。方法:我们使用GPT-4o mini将CT-RATE数据集(来自21,304名患者的24,283份CT报告)翻译成日语。训练数据集包含22,778份机器翻译报告,验证数据集包含150份经放射科医生审核的报告。我们基于“tohoku-nlp/bert-base-japanese-v3”架构开发了CT-BERT-JPN,用于从日语放射学报告中提取18项结构化 finding。结果:翻译指标表现良好,BLEU分为0.731和0.690,ROUGE分数分别为Finding部分0.770至0.876,Impression部分0.748至0.857。CT-BERT-JPN在18项条件中11项均优于GPT-4o,包括淋巴结肿大(提升14.2%)、肺叶间隔增厚(提升10.9%)和肺不张(提升7.4%)。该模型在14项条件中F1分数均超过0.95,四项条件实现完美分数。结论:我们的研究建立了稳健的日语CT报告数据集,展示了专用语言模型在结构化 finding 分类方面的有效性。机器翻译和专家验证的混合方法可在保持高质量的同时,创建大规模医学数据集。

关键词

引用

@article{arxiv.2412.15906,
  title  = {Sensitivity of functionals of McKean-Vlasov SDE's with respect to the initial distribution},
  author = {Filippo de Feo and Salvatore Federico and Fausto Gozzi and Nizar Touzi},
  journal= {arXiv preprint arXiv:2412.15906},
  year   = {2025}
}