GhazalBench:波斯语诗歌的用例导向 LLM 评估
计算与语言
2026-03-12 v1
摘要
波斯诗歌在伊朗文化实践中发挥着积极作用,诺赫拉维如哈夏赫等经典诗人的诗句经常被引用、改写或在部分提示下完成。支持此类交互需要语言模型不仅处理诗歌意义,还要处理深植于文化的表层形式。我们介绍 GhazalBench,这是一个用于评估大型语言模型 (LLM) 在波斯语 ghazal 场景下如何进行用例导向交互的基准。GhazalBench 评估两个互补能力:生成忠实的对句译文以及在不同语义和形式提示下访问经典诗句。针对多个专有和开源多语言 LLM,我们观察到一致的解离:模型通常捕捉到诗歌意义,但在完成式设置中难以准确记忆诗句,而识别式任务则显著缩小了这一差距。对英语乌托邊诗的平行评估显示,记忆表现明显高于,表明这些限制与训练暴露程度有关,而非固有的架构约束。我们的发现凸显了需要联合评估意义、形式以及依据文化重要文本的提示依赖访问的评估框架的必要性。GhazalBench 已在 https://github.com/kalhorghazal/GhazalBench 上提供。
引用
@article{arxiv.2603.09979,
title = {GhazalBench: Usage-Grounded Evaluation of LLMs on Persian Ghazals},
author = {Ghazal Kalhor and Yadollah Yaghoobzadeh},
journal= {arXiv preprint arXiv:2603.09979},
year = {2026}
}