用于技术域识别的多语言预训练 Transformer 与卷积神经网络分类模型
计算与语言
2021-01-25 v1
摘要
本文中,我们提出一个迁移学习系统,用于对多语言文本数据进行技术域识别。我们提交了两次运行,其一使用 transformer 模型 BERT,另一使用 XLM-ROBERTa 与 CNN 模型进行文本分类。这些模型使我们能够为 ICON 2020 共享任务 TechDOfication:技术域识别识别给定句子的域。我们的系统在所给 TechDOfication 数据集的子任务 1d、1g 上排名最佳。
引用
@article{arxiv.2101.09012,
title = {Multilingual Pre-Trained Transformers and Convolutional NN Classification Models for Technical Domain Identification},
author = {Suman Dowlagar and Radhika Mamidi},
journal= {arXiv preprint arXiv:2101.09012},
year = {2021}
}