面向日本病理报告编写的开源大语言模型性能评估
计算与语言
2026-03-13 v1 人工智能
摘要
大型语言模型 (LLM) 在支援日本语病理报告编写方面的性能尚未被探讨。我们从三个维度评估了来自三个来源的七个开源 LLM:(A) 按预定义格式生成和提取病理诊断文本;(B) 更正日本病理报告中的拼写错误;(C) 由病理学家和临床医生对模型生成的解释性文本进行主观评估。思考型模型和医学专用模型在需要推理的结构化报告任务以及拼写更正方面表现出优势。相比之下,对于解释性输出的偏好在不同评分者之间差异很大。尽管 LLM 的实用性因任务而异,但我们的发现表明,开源 LLM 在有限但临床相关的场景下可用于辅助日本病理报告编写。
引用
@article{arxiv.2603.11597,
title = {Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese},
author = {Masataka Kawai and Singo Sakashita and Shumpei Ishikawa and Shogo Watanabe and Anna Matsuoka and Mikio Sakurai and Yasuto Fujimoto and Yoshiyuki Takahara and Atsushi Ohara and Hirohiko Miyake and Genichiro Ishii},
journal= {arXiv preprint arXiv:2603.11597},
year = {2026}
}
备注
9 pages (including bibliography), 2 figures, 6 tables