理解大型语言模型在文化常识方面的能力与局限性
计算与语言
2024-05-09 v1
摘要
大型语言模型(LLM)通过大量的基准评估展现了扎实的常识理解能力。然而,它们对文化常识的理解在很大程度上仍未被探究。本文对几种最先进的 LLM 在文化常识任务中的能力与局限性进行了全面考察。使用多个通用与文化常识基准,我们发现:(1)LLM 在针对不同文化测试特定文化的常识知识时,性能存在显著差异;(2)LLM 的通用常识能力受文化语境影响;(3)用于查询 LLM 的语言会影响其在文化相关任务上的表现。我们的研究指出了 LLM 在文化理解方面存在的固有偏见,并提供了有助于开发具备文化意识的语言模型的见解。
引用
@article{arxiv.2405.04655,
title = {Understanding the Capabilities and Limitations of Large Language Models for Cultural Commonsense},
author = {Siqi Shen and Lajanugen Logeswaran and Moontae Lee and Honglak Lee and Soujanya Poria and Rada Mihalcea},
journal= {arXiv preprint arXiv:2405.04655},
year = {2024}
}