中文

基于数据增强的 LLM 方言适应

计算与语言 2024-04-15 v1 人工智能

摘要

本报告介绍了 GMUNLP 参与 VarDial 2024 的 Dialect-Copa 共享任务,该任务侧重于评估大型语言模型在南斯拉夫微方言上的常识推理能力。该任务旨在评估 LLM 处理非标准方言变体的能力,因为它们在标准语言上的表现已经得到充分确立。我们提出了一种方法,结合了不同类型语言模型的优势,并利用数据增强技术来提高在三种南斯拉夫方言上的任务表现:Chakavian、Cherkano 和 Torlak。我们使用了一个聚焦语系的基于编码器的模型(BERTi\'c)和一个领域无关的多语言模型(AYA-101)进行了实验。我们的结果表明,所提出的数据增强技术在开源模型类别的所有三个测试数据集上均带来了显著的性能提升。这项工作突出了数据增强的实用性以及 LLM 在处理非标准方言变体方面的潜力,有助于推进低资源和方言环境下的自然语言理解这一更广泛目标。代码:https://github.com/ffaisal93/dialect_copa

关键词

引用

@article{arxiv.2404.08092,
  title  = {Data-Augmentation-Based Dialectal Adaptation for LLMs},
  author = {Fahim Faisal and Antonios Anastasopoulos},
  journal= {arXiv preprint arXiv:2404.08092},
  year   = {2024}
}