中文

加权关键词:通过 Token 重加权提升医学报告生成的样本效率

计算与语言 2026-04-24 v1 机器学习

摘要

为医学报告生成训练视觉语言模型(VLM)时,常因高质量标注数据的稀缺而受限。本工作评估了加权损失函数以提高数据效率。与标准交叉熵损失(该损失对所有 token 预测误差相等)相比,重加权后的损失将注意力从关注临床重要性较大的语义关键 token 上移。我们在眼科学报告生成实验中表明,该简单方法在多个数据规模下均提升了效率,在最高可达十倍的训练数据下实现相似的报告质量。

关键词

引用

@article{arxiv.2604.21082,
  title  = {Weighting What Matters: Boosting Sample Efficiency in Medical Report Generation via Token Reweighting},
  author = {Alexander Weers and Daniel Rueckert and Martin J. Menten},
  journal= {arXiv preprint arXiv:2604.21082},
  year   = {2026}
}