Nunchi-Bench:面向韩国风俗的语言模型文化推理基准
计算与语言
2025-07-08 v1 人工智能
计算机与社会
摘要
随着大型语言模型 (LLMs) 成为多个领域的关键顾问,其在多文化环境中的文化敏感性和推理能力至关重要。我们引入 Nunchi-Bench,一个旨在评估 LLMs 文化理解能力的基准测试,特别关注韩国风俗。该基准包含 247 个问题,涵盖 31 个主题,用于评估事实知识、文化适当建议以及情境解释。我们评估了面向韩语和英语的多语言 LLMs,以分析其关于韩国文化语境的推理能力以及语言变化如何影响性能。为系统评估文化推理,我们提出一种新颖的评估策略,采用定制化评分指标来捕捉模型识别文化细微差别并作出恰当响应的程度。我们的发现突显了 LLMs 文化推理方面的重大挑战。尽管模型通常能识别事实信息,但在实际情境中难以加以应用。此外,显式的文化框架比仅依赖提示语言更有效。为支持进一步的研究,我们公开发布了 Nunchi-Bench 及其排行榜。
引用
@article{arxiv.2507.04014,
title = {Nunchi-Bench: Benchmarking Language Models on Cultural Reasoning with a Focus on Korean Superstition},
author = {Kyuhee Kim and Sangah Lee},
journal= {arXiv preprint arXiv:2507.04014},
year = {2025}
}