测试预训练Transformer模型用于立陶宛语新闻聚类
信息检索
2020-10-20 v1 计算与语言
机器学习
摘要
Transformer深度学习架构的近期引入在各种自然语言处理任务中取得了突破。然而,非英语语言无法利用这些英语文本预训练模型的新机会。随着聚焦于多语言模型的研究出现,这种情况发生了改变,其中使用人数较少的语言是主要受益者。我们比较了预训练多语言BERT、XLM-R以及较旧的已学文本表示方法,作为立陶宛语新闻聚类任务的编码。我们的结果表明,公开可用的预训练多语言Transformer模型可以被微调以超越词向量,但得分仍远低于专门训练的doc2vec嵌入。
引用
@article{arxiv.2004.03461,
title = {Testing pre-trained Transformer models for Lithuanian news clustering},
author = {Lukas Stankevičius and Mantas Lukoševičius},
journal= {arXiv preprint arXiv:2004.03461},
year = {2020}
}
备注
Submission accepted at https://ivus.ktu.edu/