FilBench:LLM能否理解和生成菲律宾语?
计算与语言
2025-08-06 v1
摘要
尽管大型语言模型在基于英语的任务上表现突出,但关于其在特定语言(如菲律宾语)能力的了解仍寥寥。本工作通过引入FilBench,一个以菲律宾语为中心的基准测试,来弥补这一空白,旨在评估LLM在菲律宾语、塔拉格语和塞布亚尼语中的多样化任务和能力。我们仔细筛选FilBench中的任务,以反映菲律宾NLP研究的优先事项和趋势,如文化知识、古典NLP、阅读理解和生成。通过在FilBench上评估27个最先进的LLM,我们发现多个模型在阅读理解和翻译能力方面存在不足。我们的结果表明,FilBench具有挑战性,最佳模型GPT-4o仅得分72.23%。此外,我们还发现专为东南亚语言训练的模型在FilBench上表现不佳,最佳模型SEA-LION v3 70B仅得分61.07%。我们的工作证明了筛选语言特定LLM基准的价值,以推动菲律宾NLP进程,增加菲律宾语言在LLM开发中的代表性。
引用
@article{arxiv.2508.03523,
title = {FilBench: Can LLMs Understand and Generate Filipino?},
author = {Lester James V. Miranda and Elyanah Aco and Conner Manuel and Jan Christian Blaise Cruz and Joseph Marvin Imperial},
journal= {arXiv preprint arXiv:2508.03523},
year = {2025}
}