中文

测试预训练Transformer模型用于立陶宛语新闻聚类

信息检索 2020-10-20 v1 计算与语言 机器学习

摘要

Transformer深度学习架构的近期引入在各种自然语言处理任务中取得了突破。然而,非英语语言无法利用这些英语文本预训练模型的新机会。随着聚焦于多语言模型的研究出现,这种情况发生了改变,其中使用人数较少的语言是主要受益者。我们比较了预训练多语言BERT、XLM-R以及较旧的已学文本表示方法,作为立陶宛语新闻聚类任务的编码。我们的结果表明,公开可用的预训练多语言Transformer模型可以被微调以超越词向量,但得分仍远低于专门训练的doc2vec嵌入。

关键词

引用

@article{arxiv.2004.03461,
  title  = {Testing pre-trained Transformer models for Lithuanian news clustering},
  author = {Lukas Stankevičius and Mantas Lukoševičius},
  journal= {arXiv preprint arXiv:2004.03461},
  year   = {2020}
}

备注

Submission accepted at https://ivus.ktu.edu/