中文

GATech at AbjadMed:双向编码器 vs. 因果解码器——基于82类阿拉伯语医疗分类的洞见

计算与语言 2026-03-30 v1 人工智能 机器学习

摘要

本文提出了阿拉伯语医疗文本分类系统描述,涵盖82个 distinct 类别。我们的主要架构利用经过微调的AraBERTv2编码器,增强了混合池化策略,结合注意力和均值表示,以及多样本dropout以实现稳健的正则化。我们系统性地对比了该方法与多种多语言编码器、阿拉伯语特定编码器,以及几种大规模因果解码器,包括通过Llama 3.3 70B的零样本重排序以及从Qwen 3B隐藏状态提取特征。我们的发现表明,专用双向编码器在捕获精细医疗文本分类所需的精确语义边界方面显著优于因果解码器。我们展示,因果解码器虽为下一词预测优化,却产生受序列偏好的嵌入,对分类不如能捕获全局语境。尽管存在显著的类别不平衡和标签噪声,我们的结果凸显了经过微调的编码器在专用阿拉伯语NLP任务中的语义压缩优势。最终在测试集上的性能指标,包括准确率和宏F1分数,均被报告并讨论。

关键词

引用

@article{arxiv.2603.10008,
  title  = {GATech at AbjadMed: Bidirectional Encoders vs. Causal Decoders: Insights from 82-Class Arabic Medical Classification},
  author = {Ahmed Khaled Khamis},
  journal= {arXiv preprint arXiv:2603.10008},
  year   = {2026}
}

备注

5 pages, 2 figures, EACL26, AbjadNLP