加权关键词:通过 Token 重加权提升医学报告生成的样本效率
计算与语言
2026-04-24 v1 机器学习
摘要
为医学报告生成训练视觉语言模型(VLM)时,常因高质量标注数据的稀缺而受限。本工作评估了加权损失函数以提高数据效率。与标准交叉熵损失(该损失对所有 token 预测误差相等)相比,重加权后的损失将注意力从关注临床重要性较大的语义关键 token 上移。我们在眼科学报告生成实验中表明,该简单方法在多个数据规模下均提升了效率,在最高可达十倍的训练数据下实现相似的报告质量。
引用
@article{arxiv.2604.21082,
title = {Weighting What Matters: Boosting Sample Efficiency in Medical Report Generation via Token Reweighting},
author = {Alexander Weers and Daniel Rueckert and Martin J. Menten},
journal= {arXiv preprint arXiv:2604.21082},
year = {2026}
}