X射线简化:基于日常语言的 layman 式放射报告生成与稳健评估
计算与语言
2025-05-20 v6
摘要
放射报告生成(RRG)随着多模态生成模型的发展取得了显著进展。尽管已取得进展,但该领域仍面临评估问题:现有指标缺乏鲁棒性和公平性。我们发现,RRG在现有基于词汇的指标(如BLEU)上表现良好,可能更多是幻象——模型仅通过学习报告模板即可获得高分。这在RRG中尤为突出,因为这些报告高度模式化。此外,标准放射报告常高度专业,帮助患者理解这些报告至关重要,但此前工作 largely 忽略了这一点。在本工作中,我们提出一种非直觉的方法,构建 Layman's RRG 框架以系统性地使用日常语言改进RRG。具体而言,我们框架首先贡献了一个翻译后的日常术语数据集。基于该数据集,我们提出一种基于语义的评估方法,有效缓解BLEU分数被高估的问题,提供更稳健的评估。我们表明,在日常术语数据集上训练的模型更侧重于报告的语义,而非过拟合学习报告模板。最后,我们揭示了该数据集相对于原始格式所带来的语义收益与训练样本数量之间的有前景的比例规律。
引用
@article{arxiv.2406.17911,
title = {X-ray Made Simple: Lay Radiology Report Generation and Robust Evaluation},
author = {Kun Zhao and Chenghao Xiao and Sixing Yan and Haoteng Tang and William K. Cheung and Noura Al Moubayed and Liang Zhan and Chenghua Lin},
journal= {arXiv preprint arXiv:2406.17911},
year = {2025}
}
备注
BioLaySumm shared-task 2025 official dataset