Forget NLI, Use a Dictionary: Zero-Shot Topic Classification for Low-Resource Languages with Application to Luxembourgish
计算与语言
2024-04-08 v1 人工智能
摘要
在自然语言处理中,零样本分类(ZSC)是指在目标类别没有标记样本的情况下对文本数据分配标签的任务。ZSC 的常见方法是对自然语言推理(NLI)数据集进行微调,然后使用其推断输入文档与目标标签之间的蕴涵关系。然而,这种方法在资源有限的语言上面临特定挑战。本文提出了一种替代方案,利用字典作为 ZSC 的数据来源。我们聚焦于在卢森堡 spoken 的一种低资源语言卢森布希语,构建了两个基于提供各种同义词、词汇翻译和例句的字典的主题相关性分类数据集。我们评估了数据集的可用性,并将其与 NLI 基于方法在两个主题分类任务上进行零样本比较。我们的结果表明,通过使用基于字典的数据集训练的模型在 ZSC 中优于遵循 NLI 基于方法的模型。虽然本研究仅关注单一低资源语言,但我们相信该方法的有效性也可转移到其他可获得此类字典的语言。
引用
@article{arxiv.2404.03912,
title = {Forget NLI, Use a Dictionary: Zero-Shot Topic Classification for Low-Resource Languages with Application to Luxembourgish},
author = {Fred Philippy and Shohreh Haddadan and Siwen Guo},
journal= {arXiv preprint arXiv:2404.03912},
year = {2024}
}
备注
3rd Annual Meeting of the ELRA/ISCA Special Interest Group on Under-resourced Languages (SIGUL 2024)