面向主题分类的单语与跨语言知识迁移
计算与语言
2023-07-06 v2 人工智能
摘要
本文研究了从 RuQTopics 数据集进行知识迁移。该俄语主题数据集结合了大规模样本量(361,560 条单标签、170,930 条多标签)与广泛的类别覆盖(76 类)。我们基于“Yandex Que”原始数据构建了该数据集。通过在俄罗斯语 MASSIVE 子集的六个匹配类别上评估 RuQTopics 训练的模型,我们证明了 RuQTopics 数据集适用于真实世界的对话任务,因为在该数据集上训练的仅俄语模型在此子集上始终产生约 85% 的准确率。我们还发现,对于在多语言 BERT 上,以 RuQTopics 训练并在 MASSIVE 的相同六个类别(针对所有 MASSIVE 语言)上评估,其按语言计算的准确率与该语言对应的预训练 BERT 数据的大致规模密切相关(Spearman 相关系数为 0.773,p 值为 2.997e-11)。同时,按语言计算的准确率与距俄语的语言距离之间的相关性在统计上不显著。
引用
@article{arxiv.2306.07797,
title = {Monolingual and Cross-Lingual Knowledge Transfer for Topic Classification},
author = {Dmitry Karpov and Mikhail Burtsev},
journal= {arXiv preprint arXiv:2306.07797},
year = {2023}
}