低资源环境下用于职业表述抽取与分类的 Transformer 增强方法
计算与语言
2021-09-20 v1 机器学习
摘要
本文探讨在低资源环境下改进 transformer 模型的可能途径。具体地,我们给出应对 MEDDOPROF 竞赛三个子任务中前两个子任务的方法,即西班牙语临床文本中职业表述的抽取与分类。作为既非语言也非领域专家,我们以多语言 XLM-R transformer 模型进行实验,并将这些低资源信息抽取任务作为序列标注问题处理。我们探索领域与语言自适应预训练、迁移学习以及策略性数据划分以增强 transformer 模型。结果表明,相较微调的 XLM-R 模型,使用这些方法带来最高 5.3 个 F1 点的显著提升。我们的最佳模型在前两个任务上分别取得 83.2 与 79.3 的 F1。
引用
@article{arxiv.2109.08597,
title = {Boosting Transformers for Job Expression Extraction and Classification in a Low-Resource Setting},
author = {Lukas Lange and Heike Adel and Jannik Strötgen},
journal= {arXiv preprint arXiv:2109.08597},
year = {2021}
}
备注
Published at IberLEF 2021. Best system of the NER and CLASS tracks of the MEDDOPROF shared task