中文

大语言模型能否把握隐式文化价值?基于CQ-Bench的评估

计算与语言 2025-10-10 v2

摘要

文化智能 (CQ) 指的是理解陌生文化背景的能力,这是大语言模型 (LLM) 有效地与全球多样化用户交互的关键技能。现有研究通常只关注明确表述的文化规范,却未能捕捉日常对话中常见的隐式价值。为此,我们引入CQBench,一个专为评估大语言模型从自然对话情境中推断隐式文化价值的基准测试。CQBench由基于世界价值调查和全球意见的多角色对话故事构成,涵盖伦理、宗教、社会等主题。我们的自动数据构建管道整合了严格的验证程序(包括包含性、一致性和隐式性检查),在最终验证中实现94.5%的人类模型一致性。为了利用CQBench数据,我们设计了三个递增复杂的任务:态度检测、价值选择和价值提取。这些任务评估模型是否能够检测态度并识别自然对话中嵌入的价值,而不仅仅是依赖于明确的文化知识。我们发现,虽然前沿模型如o1在价值选择上达到了人类水平的性能(0.809 F1),但在细致的态度检测方面仍有不足(0.622 F1)。值得注意的是,仅用500个富有文化色彩的示例对较小的LLaMA-3.2-3B进行微调,性能提升超过10%,在某些情况下甚至超过o3-mini。利用CQ-Bench,我们为当前大语言模型CQ研究提供了洞见,并为增强大语言模型跨文化推理能力提供了实际路径。

关键词

引用

@article{arxiv.2504.01127,
  title  = {Can LLMs Grasp Implicit Cultural Values? Benchmarking LLMs' Cultural Intelligence with CQ-Bench},
  author = {Ziyi Liu and Priyanka Dey and Jen-tse Huang and Zhenyu Zhao and Bowen Jiang and Rahul Gupta and Yang Liu and Yao Du and Jieyu Zhao},
  journal= {arXiv preprint arXiv:2504.01127},
  year   = {2025}
}