中文

阿拉伯方言识别的数据与参数高效策略探索

计算与语言 2025-09-19 v2 人工智能

摘要

本文讨论了我们对阿拉伯方言识别(ADI)不同数据高效和参数高效方法的探索。具体而言,我们研究了各种软提示策略,包括前缀调谐、提示调谐、P-tuning 和 P-tuning V2,以及 LoRA 重参数化。在数据高效策略方面,我们分析了硬提示的零样本和少样本推断,以分析大型语言模型(LLM)在方言识别能力方面的表现。在参数高效的 PEFT 方法方面,我们使用阿拉伯专用编码器模型在多个主要数据集上进行实验。我们还分析了在开源解码器模型上的 n 样本推断,包括通用多语言模型(Phi-3.5)和阿拉伯专用模型(SILMA)。我们观察到,LLM 在少样本或零样本设置下难以区分方言细微差异。软提示编码器变体表现更好,而 LoRA 基于微调的模型表现最佳,甚至超过完整微调。

关键词

引用

@article{arxiv.2509.13775,
  title  = {Exploring Data and Parameter Efficient Strategies for Arabic Dialect Identifications},
  author = {Vani Kanjirangat and Ljiljana Dolamic and Fabio Rinaldi},
  journal= {arXiv preprint arXiv:2509.13775},
  year   = {2025}
}

备注

4 main pages, 4 additional, 5 figures