无中生有:零样本跨语言关键词检测是否优于无监督方法?
计算与语言
2022-02-15 v1 机器学习
摘要
关键词抽取是检索对给定文档内容至关重要的词的任务。研究者提出了多种方法来解决该问题。在最高层面上,方法分为需要训练的——有监督的,以及不需要训练的——无监督的。在本研究中,我们关注所考察语言无训练数据可用的设定。更具体地,我们探究预训练多语言语言模型是否可用于低资源语言的零样本跨语言关键词抽取(其标注训练数据有限或缺失),以及它们是否优于最先进的无监督关键词抽取器。比较在六个新闻文章数据集上进行,涵盖两种高资源语言(英语和俄语)以及四种低资源语言(克罗地亚语、爱沙尼亚语、拉脱维亚语和斯洛文尼亚语)。我们发现,在多语言语料上微调的预训练模型(该语料覆盖未出现在测试集中的语言,即零样本设定下)在所有六种语言上一致超越无监督模型。
引用
@article{arxiv.2202.06650,
title = {Out of Thin Air: Is Zero-Shot Cross-Lingual Keyword Detection Better Than Unsupervised?},
author = {Boshko Koloski and Senja Pollak and Blaž Škrlj and Matej Martinc},
journal= {arXiv preprint arXiv:2202.06650},
year = {2022}
}