跨语言文本分类迁移:以乌克兰语为例
计算与语言
2025-02-06 v2 人工智能
摘要
尽管NLP文本分类领域存在大量标注数据集,但不同语言之间数据可用性的持续不平衡仍然明显。为了支持NLP模型的进一步公平发展,探索有效知识迁移到新语言的可能性至关重要。乌克兰语尤其是一种仍然可以从跨语言方法的持续改进中受益的语言。据我们所知,乌克兰语在典型文本分类任务(即不同类型风格、有害言论或文本关系)的语料库严重缺乏。然而,从头开始收集此类语料库所需的资源量是可以理解的。在这项工作中,我们利用NLP的最新进展,探索避免手动数据整理的跨语言知识迁移方法:大型多语言编码器和翻译系统、LLM和语言适配器。我们在三个文本分类任务(毒性分类、形式性分类和自然语言推理NLI)上测试了这些方法,为每个任务提供了最佳设置的“配方”。
引用
@article{arxiv.2404.02043,
title = {Cross-lingual Text Classification Transfer: The Case of Ukrainian},
author = {Daryna Dementieva and Valeriia Khylenko and Georg Groh},
journal= {arXiv preprint arXiv:2404.02043},
year = {2025}
}
备注
COLING2025, main, short