中文

揭示文化盲点:分析 mLLMs 在程序化文本理解中的局限性

计算与语言 2025-02-21 v1

摘要

尽管多语言大语言模型 (mLLMs) 在各种自然语言处理任务中表现出色,但其理解包含特定文化内容的程序化文本的能力仍鲜有探索。描述文化程序的文本,包括仪式、传统工艺和社交礼仪,需要对文化背景的内在理解,这对 mLLMs 构成了重大挑战。本文引入了 CAPTex,一个旨在评估 mLLMs 处理和推理多语言文化多样化程序化文本能力的基准测试,通过 various methodologies 评估其性能。我们的发现表明:(1) mLLMs 在包含文化背景的程序化文本方面面临困难,在低资源语言中表现显著下降;(2) 模型性能在不同文化领域之间波动,部分领域呈现更大的挑战;(3) 在对话框架中的多选任务中,语言模型的表现优于直接提问。这些结果凸显了 mLLMs 在处理文化细化程序化文本方面的当前局限性,强调了像 CAPTex 这样具有文化意识的基准测试对于增强其在多样化语言和文化景观中的适应性和理解能力的必要性。

关键词

引用

@article{arxiv.2502.14315,
  title  = {Unveiling Cultural Blind Spots: Analyzing the Limitations of mLLMs in Procedural Text Comprehension},
  author = {Amir Hossein Yari and Fajri Koto},
  journal= {arXiv preprint arXiv:2502.14315},
  year   = {2025}
}