中文

医学摘要分类的轻量基线:DistilBERT 采用交叉熵作为强大默认选项

计算与语言 2025-10-22 v2 人工智能

摘要

本研究评估了在财政预算受限的情况下,医学摘要分类的轻量方法,以确定其最大性能能力。在公共医学摘要语料库上,我们以三种目标函数对 BERT base 和 DistilBERT 进行微调:交叉熵 (CE)、加权交叉熵和焦点损失,在相同的 tokenization、序列长度、优化器和调度设置下进行。DistilBERT 采用纯 CE 在原始 argmax 权衡中表现最强,而在经过后验操作的运行点选择(验证校准、类别阈值)后,部署性能得到显著提升;在此调校后,焦点损失受益最大。我们报告 Accuracy、Macro F1 和 WeightedF1,发布评估数据,包含混淆分析以阐明错误结构。实践中的关键建议是:首先使用紧凑编码器和 CE,然后在部署需要更高宏观平衡时添加轻量校准或阈值选择。

关键词

引用

@article{arxiv.2510.10025,
  title  = {Lightweight Baselines for Medical Abstract Classification: DistilBERT with Cross-Entropy as a Strong Default},
  author = {Jiaqi Liu and Tong Wang and Su Liu and Xin Hu and Ran Tong and Lanruo Wang and Jiexi Xu},
  journal= {arXiv preprint arXiv:2510.10025},
  year   = {2025}
}

备注

Healthcare AI, Medical Text Classification,LLM, DistilBERT