BLEnD:面向多样文化与语言的 LLM 日常知识基准
计算与语言
2025-01-17 v2
摘要
大语言模型 (LLM) 常常缺乏特定文化中日常生活知识,尤其是在多样地区和非英语语言方面。现有的评估 LLM 文化敏感性的基准要么仅支持单一语言,要么来自在线资源如维基百科,这些资源不反映不同地区日常生活方式。也就是说,人们在生日庆祝活动中吃的食物、通常使用的香料、年轻人玩的乐器或在学校从事的运动等文化常识在容易获取的在线资源中并不常见,尤其是对被边缘化文化而言。为此,我们引入BLEnD,一个手工构建的基准,用于评估 LLM 在多样文化和语言中的日常知识。BLEnD 包含来自 16 个国家/地区、13 种不同语言(包括阿拉哈姆语、阿萨姆语、阿齐巴蒙语、豪萨语和苏拉尼语等资源较少的语言)的 52.6k 个问答对。我们构建基准包括两种问题格式:简答题和多选题。我们显示,LLM 在高度在线表示的文化方面表现更好,在 GPT-4(表现最好的模型)中,简答格式中最高可达 57.34% 的性能差异。对于中到高资源语言表示的文化,LLM 在本土语言中表现更好,但对于资源较少的语言表示的文化,LLM 在英语中表现优于本土语言。我们将该数据集公开于:https://github.com/nlee0212/BLEnD。
引用
@article{arxiv.2406.09948,
title = {BLEnD: A Benchmark for LLMs on Everyday Knowledge in Diverse Cultures and Languages},
author = {Junho Myung and Nayeon Lee and Yi Zhou and Jiho Jin and Rifki Afina Putri and Dimosthenis Antypas and Hsuvas Borkakoty and Eunsu Kim and Carla Perez-Almendros and Abinew Ali Ayele and Víctor Gutiérrez-Basulto and Yazmín Ibáñez-García and Hwaran Lee and Shamsuddeen Hassan Muhammad and Kiwoong Park and Anar Sabuhi Rzayev and Nina White and Seid Muhie Yimam and Mohammad Taher Pilehvar and Nedjma Ousidhoum and Jose Camacho-Collados and Alice Oh},
journal= {arXiv preprint arXiv:2406.09948},
year = {2025}
}
备注
Accepted to NeurIPS 2024 Datasets & Benchmark Track