HKCanto-Eval:用于评估 LLM 中粤语语言理解与文化理解的基准
计算与语言
2025-07-08 v2
摘要
语言模型在多样化的语言和文化背景下理解和交互的能力至关重要。香港使用的粤语对自然语言处理构成独特挑战,由于其丰富的文化细微差别以及缺乏专门评估数据集。HKCanto-Eval 数据集通过评估大型语言模型 (LLM) 在粤语语言理解任务上的表现,扩展至英语和书面中文进行跨语言评估。HKCanto-Eval 集成了香港特有的文化和语言细微差别,为在真实场景中评估语言模型提供了稳健框架。此外,数据集包含旨在触及模型底层语言元知识的问题。我们的发现表明,尽管专有模型通常优于开源权重模型,但在处理粤语特定语言和文化知识方面仍存在显著局限,这凸显了需要更多针对性训练数据和评估方法的需求。代码可在 https://github.com/hon9kon9ize/hkeval2025 获取。
引用
@article{arxiv.2503.12440,
title = {HKCanto-Eval: A Benchmark for Evaluating Cantonese Language Understanding and Cultural Comprehension in LLMs},
author = {Tsz Chung Cheng and Chung Shing Cheng and Chaak Ming Lau and Eugene Tin-Ho Lam and Chun Yat Wong and Hoi On Yu and Cheuk Hei Chong},
journal= {arXiv preprint arXiv:2503.12440},
year = {2025}
}