中文

用于技术域识别的多语言预训练 Transformer 与卷积神经网络分类模型

计算与语言 2021-01-25 v1

摘要

本文中,我们提出一个迁移学习系统,用于对多语言文本数据进行技术域识别。我们提交了两次运行,其一使用 transformer 模型 BERT,另一使用 XLM-ROBERTa 与 CNN 模型进行文本分类。这些模型使我们能够为 ICON 2020 共享任务 TechDOfication:技术域识别识别给定句子的域。我们的系统在所给 TechDOfication 数据集的子任务 1d、1g 上排名最佳。

关键词

引用

@article{arxiv.2101.09012,
  title  = {Multilingual Pre-Trained Transformers and Convolutional NN Classification Models for Technical Domain Identification},
  author = {Suman Dowlagar and Radhika Mamidi},
  journal= {arXiv preprint arXiv:2101.09012},
  year   = {2021}
}