利用合成数据扩展阿拉伯语医疗聊天机器人:以合成患者记录增强生成式 AI
计算与语言
2025-09-15 v1
摘要
阿拉伯语医疗聊天机器人的发展因缺乏大规模、高质量的标注数据集而受到严重制约。尽管先前的研究从社交媒体中收集了 20,000 条阿拉伯语医患交互数据来微调大型语言模型(LLMs),但模型的可扩展性和泛化能力仍然有限。在本研究中,我们提出了一种可扩展的合成数据增强策略,将训练语料库扩展至 100,000 条记录。利用先进的生成式 AI 系统 ChatGPT-4o 和 Gemini 2.5 Pro,我们以原始数据集的结构为基础,生成了 80,000 条语境相关且医学逻辑连贯的合成问答对。这些合成样本经过语义过滤、人工验证,并被整合到训练流程中。我们微调了五个 LLMs,包括 Mistral-7B 和 AraGPT2,并使用 BERTScore 指标和专家驱动的定性评估来评估其性能。为了进一步分析合成数据源的有效性,我们进行了一项消融实验,独立比较了 ChatGPT-4o 和 Gemini 生成的数据。结果显示,在所有模型中,ChatGPT-4o 生成的数据始终带来更高的 F1 分数和更少的幻觉。总体而言,我们的研究结果表明,合成数据增强作为一种实用方案,能够有效增强低资源医疗自然语言处理中的领域特定语言模型,为构建更具包容性、可扩展性和准确性的阿拉伯语医疗聊天机器人系统铺平了道路。
引用
@article{arxiv.2509.10108,
title = {Scaling Arabic Medical Chatbots Using Synthetic Data: Enhancing Generative AI with Synthetic Patient Records},
author = {Abdulrahman Allam and Seif Ahmed and Ali Hamdi and Khaled Shaban},
journal= {arXiv preprint arXiv:2509.10108},
year = {2025}
}
备注
Accepted in AICCSA 2025