迈向地理文化扎根的 LLM 生成
计算与语言
2025-07-17 v4 人工智能
摘要
生成式大型语言模型 (LLMs) 在全球范围内表现出对不同文化的认知差距。我们研究了检索增强生成与搜索扎根技术对 LLM 展现对各国文化熟悉程度的能力的影响。具体而言,我们在多个文化认知基准上比较了标准 LLM、使用来自定制知识库的检索进行增强的 LLM(即 KB 扎根)以及使用来自网络搜索的检索进行增强的 LLM(即搜索扎根)的性能。我们发现,搜索扎根显著提升了 LLM 在测试命题知识(例如文化规范、人工制品和制度)的多项选择基准上的表现,而 KB 扎根的有效性则受限于知识库覆盖不足和次优的检索器。然而,搜索扎根也增加了语言模型做出刻板判断的风险,并且在具有足够统计功效的人工评估中,未能改善评估者对文化熟悉度的判断。这些结果突显了在评估 LLM 的文化认知时,命题性文化知识与开放式文化流利度之间的区别。
引用
@article{arxiv.2502.13497,
title = {Towards Geo-Culturally Grounded LLM Generations},
author = {Piyawat Lertvittayakumjorn and David Kinney and Vinodkumar Prabhakaran and Donald Martin and Sunipa Dev},
journal= {arXiv preprint arXiv:2502.13497},
year = {2025}
}
备注
ACL 2025 (main conference)