中文

HKCanto-Eval:用于评估 LLM 中粤语语言理解与文化理解的基准

计算与语言 2025-07-08 v2

摘要

语言模型在多样化的语言和文化背景下理解和交互的能力至关重要。香港使用的粤语对自然语言处理构成独特挑战,由于其丰富的文化细微差别以及缺乏专门评估数据集。HKCanto-Eval 数据集通过评估大型语言模型 (LLM) 在粤语语言理解任务上的表现,扩展至英语和书面中文进行跨语言评估。HKCanto-Eval 集成了香港特有的文化和语言细微差别,为在真实场景中评估语言模型提供了稳健框架。此外,数据集包含旨在触及模型底层语言元知识的问题。我们的发现表明,尽管专有模型通常优于开源权重模型,但在处理粤语特定语言和文化知识方面仍存在显著局限,这凸显了需要更多针对性训练数据和评估方法的需求。代码可在 https://github.com/hon9kon9ize/hkeval2025 获取。

关键词

引用

@article{arxiv.2503.12440,
  title  = {HKCanto-Eval: A Benchmark for Evaluating Cantonese Language Understanding and Cultural Comprehension in LLMs},
  author = {Tsz Chung Cheng and Chung Shing Cheng and Chaak Ming Lau and Eugene Tin-Ho Lam and Chun Yat Wong and Hoi On Yu and Cheuk Hei Chong},
  journal= {arXiv preprint arXiv:2503.12440},
  year   = {2025}
}