中文

从 MTEB 到 MTOB:描述性语法的检索增强分类

图像与视频处理 2024-11-26 v1 计算机视觉与模式识别

摘要

近期语言模型进展显现出在零样图能力方面的显著提升,包括情境学习、指令遵循和极少数语言的机器翻译 (Tanzer 等,2024)。然而,许多语言主要依赖语法和词汇的正式描述,而非书面资源。在本文中,我们引入一套基准测试,以评估模型从语言语法中复杂描述中提取和分类信息的能力。我们提出一种基于检索增强生成 (RAG) 的方法,利用这些描述为下游任务(如机器翻译)提供支持。该基准测试涵盖 248 种语言的语言描述,覆盖 142 个语言族,聚焦 WALS 和 Grambank 中的类型特征。该基准测试为评估语言模型准确解释和提取语言特征的情境能力提供了关键资源,为扩展低资源语言的 NLP 提供了必要支持。代码和数据已公开于 \url{https://github.com/al-the-eigenvalue/RAG-on-grammars}。

关键词

引用

@article{arxiv.2411.15576,
  title  = {MulModSeg: Enhancing Unpaired Multi-Modal Medical Image Segmentation with Modality-Conditioned Text Embedding and Alternating Training},
  author = {Chengyin Li and Hui Zhu and Rafi Ibn Sultan and Hassan Bagher Ebadian and Prashant Khanduri and Chetty Indrin and Kundan Thind and Dongxiao Zhu},
  journal= {arXiv preprint arXiv:2411.15576},
  year   = {2024}
}

备注

Accepted by WACV-2025