DSG-KD:从领域特定到通用语言模型的知识蒸馏
计算与语言
2024-09-24 v1 人工智能
摘要
使用针对特定下游任务微调的预训练语言模型是自然语言处理 (NLP) 中的常见做法。然而,通过微调获取领域特定知识具有挑战性。传统方法涉及使用大量领域特定数据进行预训练,然后进行特定任务的微调。本研究基于来自韩国儿童急诊部门 (PEDs) 的电子医疗记录 (EMR) 数据, investigate 急诊/非急诊分类任务。我们的发现表明,现有的领域特定预训练语言模型在处理非英语地区 N 语言自由文本数据时,表现不如通用语言模型。为解决这些限制,我们提出一种领域知识转移方法,通过知识蒸馏将通用语言模型注入领域特定知识。该研究通过将通用语言模型定义为学生模型、领域特定预训练模型定义为教师模型,展示了模型之间专门知识的有效传递。特别是,我们解决了来自非英语地区(如韩国)PEDs 的 EMR 数据的复杂性,证明了该方法在此类上下文中增强了分类性能。该方法不仅在韩国 PED EMR 数据上超越基线模型,也在 various 专业和技术领域具有更广泛的适用性。在未来的工作中,我们计划将该方法扩展到包括多样非英语地区,并解决额外的下游任务,以开发更先进的模型架构。代码已公开于 https://github.com/JoSangYeon/DSG-KD。
引用
@article{arxiv.2409.14904,
title = {DSG-KD: Knowledge Distillation from Domain-Specific to General Language Models},
author = {Sangyeon Cho and Jangyeong Jeon and Dongjoon Lee and Changhee Lee and Junyeong Kim},
journal= {arXiv preprint arXiv:2409.14904},
year = {2024}
}
备注
IEEE ACCESS 2024