一种面向阿拉伯语医学文本生成的基于严重程度的课程学习策略
计算与语言
2026-04-09 v1 人工智能
摘要
阿拉伯语医学文本生成正日益受到关注,以帮助用户以母语解读症状并获取一般健康指导。然而,许多现有方法假设训练样本具有同等重要性,忽视了临床严重程度的差异。这种简化可能阻碍模型正确捕捉复杂或高风险病例的能力。为克服这一问题,本工作提出了一种面向阿拉伯语医学文本生成的基于严重程度的课程学习策略,其中训练过程被设计为从较轻到更严重的医疗状况逐步推进。该方法根据严重程度将数据集划分为有序阶段,并在微调过程中逐步向模型暴露更具挑战性的病例,使其首先学习基本医学模式,然后再处理更复杂的场景。所提出的方法在医学阿拉伯语问答(MAQA)数据集的一个子集上进行评估,该数据集包含描述症状的阿拉伯语医学问题及相应回答。此外,本研究使用一种基于规则的方法对该数据集进行了三个严重程度级别(轻度、中度和重度)的标注。结果表明,融入严重程度感知的课程学习在所有测试模型上均带来了一致的性能提升,相比基线模型提升约4%至7%,相比传统微调方法提升约3%至6%。
引用
@article{arxiv.2604.06365,
title = {A Severity-Based Curriculum Learning Strategy for Arabic Medical Text Generation},
author = {Ahmed Alansary and Molham Mohamed and Ali Hamdi},
journal= {arXiv preprint arXiv:2604.06365},
year = {2026}
}
备注
10 pages, 2 figures, 2 tables, ICTIS2026