中文

一种通用多语言文档编码器

计算与语言 2023-05-12 v1

摘要

大规模多语言预训练Transformer(MMT)极大地推动了多语言NLP尤其是NLP模型跨语言迁移的技术水平。尽管大量工作利用MMT挖掘平行数据并诱导双语文档嵌入,但训练可用于有监督与无监督文档级任务的通用(大规模)多语言文档编码器的努力却少得多。在本工作中,我们将一个大规模多语言文档编码器预训练为一个分层Transformer模型(HMDE),其中浅层文档Transformer对由最先进的预训练多语言句子编码器生成的句子表示进行上下文建模。我们利用Wikipedia作为现成的可比文档来源以创建训练数据,并通过跨语言对比目标训练HMDE,进一步利用Wikipedia的类别层次结构来构造困难负样本。我们在两个可以说最常见且重要的跨语言文档级任务中评估HMDE的有效性:(1)主题文档分类的跨语言迁移;(2)跨语言文档检索。HMDE显著优于(i)基于片段表示的聚合方法以及(ii)多语言Longformer。关键在于,由于其大规模多语言底层Transformer,HMDE成功泛化到文档级预训练中未见过语言。我们在 https://github.com/ogaloglu/pre-training-multilingual-document-encoders 公开发布代码与模型。

关键词

引用

@article{arxiv.2305.07016,
  title  = {A General-Purpose Multilingual Document Encoder},
  author = {Onur Galoğlu and Robert Litschko and Goran Glavaš},
  journal= {arXiv preprint arXiv:2305.07016},
  year   = {2023}
}