中文

Fann 或 Flop:面向 LLM 的阿拉伯诗歌理解的多体裁、多年代基准

计算与语言 2025-05-27 v2

摘要

阿拉伯诗歌是阿拉伯语中最丰富、最具文化根基的表达形式,因其层次丰富的含义、风格的多样性和深厚的历史连续性而闻名。尽管大型语言模型(LLM)在各种语言和任务上已显示出强大的性能,但其理解阿拉伯诗歌的能力仍鲜有探索。本文引入了\emph{Fann or Flop},这是第一个设计用于评估 LLM 在 12 个历史时代中理解阿拉伯诗歌的基准,覆盖 14 种核心诗歌体裁和从古典结构到当代自由诗的多种韵律形式。该基准包含一套精选诗歌语料库,配有解释性注释,用于评估语义理解、隐喻解读、韵律意识和文化背景。我们认为,诗歌理解是测试 LLM 理解古典阿拉伯语的强指标。不同于表面级任务,这一领域需要更深层的解释推理和文化敏感性。我们对主流 LLM 进行评估,发现大多数模型在诗歌理解方面仍表现不佳,尽管在标准阿拉伯语基准测试中表现良好。我们将"Fann or Flop"及其评估套件作为开源资源发布,以便进行严格的评估和推动阿拉伯语言模型的发展。代码已公开:https://github.com/mbzuai-oryx/FannOrFlop。

关键词

引用

@article{arxiv.2505.18152,
  title  = {Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs},
  author = {Wafa Alghallabi and Ritesh Thawkar and Sara Ghaboura and Ketan More and Omkar Thawakar and Hisham Cholakkal and Salman Khan and Rao Muhammad Anwer},
  journal= {arXiv preprint arXiv:2505.18152},
  year   = {2025}
}

备注

Github:https://github.com/mbzuai-oryx/FannOrFlop, Dataset:https://huggingface.co/datasets/omkarthawakar/FannOrFlop