Jawaher:面向大语言模型基准测试的多方言阿拉伯谚语数据集
计算与语言
2025-03-04 v1 人工智能
摘要
近期,指令微调、基于人类反馈的强化学习(RLHF)等对齐方法以及直接偏好优化(DPO)等优化技术的进步,显著增强了大语言模型(LLMs)对用户偏好的适应能力。然而,尽管有这些创新,许多LLMs仍然表现出对西方、以英语为中心或美国文化的偏见,在英语数据上的性能始终超过其他语言。这揭示了LLMs中持续存在的文化差距,使其难以准确处理文化丰富且多样的比喻性语言,如谚语。为了解决这一问题,我们引入了Jawaher,一个用于评估LLMs理解和解释阿拉伯谚语能力的基准。Jawaher包含来自各种阿拉伯方言的谚语,以及惯用翻译和解释。通过对开源和闭源模型进行广泛评估,我们发现虽然LLMs可以生成惯用准确的翻译,但它们在生成文化上细致且上下文相关的解释方面存在困难。这些发现强调了持续改进模型和扩展数据集以弥补比喻性语言处理中文化差距的必要性。
引用
@article{arxiv.2503.00231,
title = {Jawaher: A Multidialectal Dataset of Arabic Proverbs for LLM Benchmarking},
author = {Samar M. Magdy and Sang Yun Kwon and Fakhraddin Alwajih and Safaa Abdelfadil and Shady Shehata and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2503.00231},
year = {2025}
}
备注
Project GitHub page is accessible at: https://github.com/UBC-NLP/jawaher