波斯语大语言模型对齐基准测试 ELAB
计算与语言
2025-04-18 v1
摘要
本文提出了一个全面的评估框架,用于对齐波斯语大语言模型(LLMs)的关键伦理维度,包括安全性、公平性和社会规范。它解决了现有 LLM 评估框架在波斯语语言和文化语境下不足的問題。这一基准测试创建了三种波斯语语言基准测试:(i)翻译后的数据,(ii)合成生成的新数据,(iii)自然收集的新数据。我们将 Anthropic Red Teaming 数据、AdvBench、HarmBench 和 DecodingTrust 翻译成波斯语。此外,我们创建了 ProhibiBench-fa、SafeBench-fa、FairBench-fa 和 SocialBench-fa 四个新数据集,以解决波斯语文化背景下有害和禁止内容。我们收集了大规模数据集作为 GuardBench-fa,以考虑波斯语文化规范。通过整合这些数据集,我们的工作建立了一个统一的框架,用于评估波斯语 LLMs,提供了一种以文化为基础的对齐评估方法。我们对波斯语 LLMs 在三个对齐方面的系统评估:安全性(避免有害内容)、公平性(减轻偏见)和社会规范(遵守文化被接受的行为)。我们提供了一个公开可用的排行榜,在该排行榜上对波斯语 LLMs 进行安全性、公平性和社会规范的基准测试,网址为:https://huggingface.co/spaces/MCILAB/LLM_Alignment_Evaluation。
引用
@article{arxiv.2504.12553,
title = {ELAB: Extensive LLM Alignment Benchmark in Persian Language},
author = {Zahra Pourbahman and Fatemeh Rajabi and Mohammadhossein Sadeghi and Omid Ghahroodi and Somaye Bakhshaei and Arash Amini and Reza Kazemi and Mahdieh Soleymani Baghshah},
journal= {arXiv preprint arXiv:2504.12553},
year = {2025}
}