日本胸部CT报告大型数据集的开发与高性能病灶分类模型
计算与语言
2025-09-03 v1 人工智能
摘要
背景:近期大型语言模型的进展凸显了高质量多语言医疗数据的需求。虽然日本在全球 CT 扫描仪器部署和利用方面处于领先地位,但缺乏大型日语放射学数据集已阻碍了针对医学影像分析的专业语言模型开发。目的:通过机器翻译开发完整的日本 CT 报告数据集,建立专门的语言模型用于结构化病灶分类。同时,通过专家放射科医师审核创建严格验证的评估数据集。方法:我们使用 GPT-4o mini 将 CT-RATE 数据集(24,283 份来自 21,304 名患者的 CT 报告)翻译成日语。训练数据集包含 22,778 份机器翻译报告,验证数据集包含 150 份经放射科医师审核的报告。我们基于 "tohoku-nlp/bert-base-japanese-v3" 架构开发了用于从日语放射学报告中提取 18 项结构化病灶的 CT-BERT-JPN。结果:翻译指标表现良好,BLEU 分数为 0.731 和 0.690,ROUGE 分数分别为 Findings 部分 0.770-0.876,Impression 部分 0.748-0.857。CT-BERT-JPN 在 11 项疾病中优于 GPT-4o,包括淋巴结肿大 (+14.2%)、肺叶间隔增厚 (+10.9%) 和肺不张 (+7.4%)。该模型在 14 项疾病中保持 F1 分数超过 0.95,并在四项中达到完美分数。结论:我们的研究建立了稳健的日本 CT 报告数据集,证明了专门语言模型在结构化病灶分类方面的有效性。机器翻译与专家验证的混合方法可在保持高质量的同时创建大规模医疗数据集。
引用
@article{arxiv.2412.15907,
title = {Development of a Large-scale Dataset of Chest Computed Tomography Reports in Japanese and a High-performance Finding Classification Model},
author = {Yosuke Yamagishi and Yuta Nakamura and Tomohiro Kikuchi and Yuki Sonoda and Hiroshi Hirakawa and Shintaro Kano and Satoshi Nakamura and Shouhei Hanaoka and Takeharu Yoshikawa and Osamu Abe},
journal= {arXiv preprint arXiv:2412.15907},
year = {2025}
}
备注
Dataset available at https://huggingface.co/datasets/YYama0/CT-RATE-JPN