衡量香港大规模多任务语言理解能力
计算与语言
2025-05-06 v1
摘要
多语言理解能力对于大语言模型(LLMs)的跨文化适用性至关重要。然而,针对香港独特的语言环境(融合了繁体中文书写、粤语口语及其文化背景)设计的评估基准仍不完善。为填补这一空白,我们引入了 HKMMLU,一个用于评估香港语言能力和社会文化知识的多任务语言理解基准。HKMMLU 包含 26,698 道选择题,涵盖 66 个学科,分为四大类:科学、技术、工程和数学(STEM)、社会科学、人文学科及其他。为评估大语言模型的多语言理解能力,我们还额外加入了 90,550 个普通话-粤语翻译任务。我们在 HKMMLU 上对 GPT-4o、Claude 3.7 Sonnet 以及 18 个不同规模的开源大语言模型进行了全面实验。结果显示,表现最佳的模型 DeepSeek-V3 也难以达到 75% 的准确率,显著低于其在 MMLU 和 CMMLU 上的表现。这一性能差距凸显了提升大语言模型在香港特定语言和知识领域能力的必要性。此外,我们还研究了问题语言、模型规模、提示策略以及问题和推理词元长度如何影响模型性能。我们预期 HKMMLU 将显著推动大语言模型在多语言和跨文化背景下的发展,从而促成更广泛、更有影响力的应用。
引用
@article{arxiv.2505.02177,
title = {Measuring Hong Kong Massive Multi-Task Language Understanding},
author = {Chuxue Cao and Zhenghao Zhu and Junqi Zhu and Guoying Lu and Siyu Peng and Juntao Dai and Weijie Shi and Sirui Han and Yike Guo},
journal= {arXiv preprint arXiv:2505.02177},
year = {2025}
}