从常识到风俗:评估孟加拉文化知识的大语言模型
计算与语言
2025-10-24 v1 机器学习
摘要
近期的 NLP 研究进展表明,大语言模型(LLM)在广泛的任务中展现出惊人的能力。虽然近期的多语言基准推进了 LLM 的文化评估,但在捕捉低资源文化细微差异方面仍存在关键缺口。我们的工作通过孟加拉语言文化知识(BLanCK)数据集来弥补这些限制,数据集包括民间传说、烹饪艺术和地区方言。我们的研究表明,尽管这些模型在非文化类别中表现良好,但在文化知识方面表现严重不足,当提供上下文后,所有模型的性能都会显著提升,这强调了具有上下文感知能力的架构和文化精选训练数据的重要性。
引用
@article{arxiv.2510.20043,
title = {From Facts to Folklore: Evaluating Large Language Models on Bengali Cultural Knowledge},
author = {Nafis Chowdhury and Moinul Haque and Anika Ahmed and Nazia Tasnim and Md. Istiak Hossain Shihab and Sajjadur Rahman and Farig Sadeque},
journal= {arXiv preprint arXiv:2510.20043},
year = {2025}
}
备注
4 pages