中文

语句微调使仅编码器模型实现高效的跨语言泛化

计算与语言 2025-06-03 v1

摘要

Large Language Models (LLMs) 在零样本和少样本任务中表现出色,但由于架构限制,在 BERT 和 RoBERTa 等仅编码器模型上实现类似性能一直具有挑战性。然而,编码器具有计算和内存成本更低等优势。近期工作使用 Statement Tuning 将其适配于零样本泛化,该方法将任务重构为有限的模板。我们将该方法扩展至多语言 NLP,探讨编码器能否实现零样本跨语言泛化,并作为低资源语言下高内存消耗 LLM 的高效替代方案。我们的结果表明,state-of-the-art 编码器模型跨语言泛化表现良好,可媲美多语言 LLM 且更为高效。我们还分析了多语言 Statement Tuning 数据集设计、效率提升以及特定语言的泛化,有助于构建更具包容性和资源高效的 NLP 模型。我们发布了代码和模型。

关键词

引用

@article{arxiv.2506.01592,
  title  = {Statement-Tuning Enables Efficient Cross-lingual Generalization in Encoder-only Models},
  author = {Ahmed Elshabrawy and Thanh-Nhi Nguyen and Yeeun Kang and Lihan Feng and Annant Jain and Faadil Abdullah Shaikh and Jonibek Mansurov and Mohamed Fazli Mohamed Imam and Jesus-German Ortiz-Barajas and Rendi Chevi and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2506.01592},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Findings)