中文

EPT基准:大型语言模型中波斯语可信度的评估

计算与语言 2025-09-09 v1 密码学与安全

摘要

大型语言模型(LLM)基于广泛的先进深度学习架构数据集进行训练,在广泛的语言任务中展现出卓越的性能,已成为现代人工智能技术的基石。然而,确保其可信度仍然是一个关键挑战,因为可靠性不仅对于准确性能至关重要,而且对于维护伦理、文化和社会价值观也至关重要。精心对齐训练数据和基于文化的评估标准对于开发负责任的人工智能系统至关重要。在本研究中,我们引入了EPT(波斯语可信度评估)指标,这是一个基于文化的基准,专门设计用于从六个关键方面评估LLM的可信度:真实性、安全性、公平性、鲁棒性、隐私性和伦理对齐。我们策划了一个标注数据集,并使用基于LLM的自动评估和人工评估两种方式,评估了包括ChatGPT、Claude、DeepSeek、Gemini、Grok、LLaMA、Mistral和Qwen在内的多个领先模型的性能。我们的结果揭示了安全性维度上的显著缺陷,突显了迫切需要关注模型行为的这一关键方面。此外,我们的发现为这些模型与波斯伦理文化价值观的对齐提供了宝贵的见解,并指出了推进可信且文化负责任的AI的关键差距和机遇。该数据集可在以下地址公开获取:https://github.com/Rezamirbagheri110/EPT-Benchmark。

关键词

引用

@article{arxiv.2509.06838,
  title  = {EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models},
  author = {Mohammad Reza Mirbagheri and Mohammad Mahdi Mirkamali and Zahra Motoshaker Arani and Ali Javeri and Amir Mahdi Sadeghzadeh and Rasool Jalili},
  journal= {arXiv preprint arXiv:2509.06838},
  year   = {2025}
}