中文

泪水还是欢呼?通过文化引出的差异化情感反应对 LLM 进行基准测试

计算与语言 2026-01-21 v1

摘要

文化是人类情感处理的基本决定因素,深刻影响着个体感知和解释情感刺激的方式。尽管存在这种内在联系,现有关于大语言模型(LLM)文化对齐的评估主要优先考虑诸如地理事实或既定社会习俗等陈述性知识。这些基准不足以捕捉不同社会文化视角所固有的主观解释差异。为了解决这一局限性,我们引入了 CEDAR,一个完全由捕捉文化引出的差异化情感反应(Culturally Elicited Distinct Affective Responses)的场景构成的多模态基准。为了构建 CEDAR,我们实现了一个新颖的流水线,利用 LLM 生成的临时标签来隔离产生跨文化情感差异的实例,随后通过严格的人工评估得出可靠的真值标注。最终的基准包含跨七种语言和 14 个细粒度情感类别的 10,962 个实例,每种语言包含 400 个多模态样本和 1,166 个纯文本样本。对 17 个具有代表性的多语言模型的全面评估揭示了语言一致性与文化对齐之间的分离,表明基于文化的情感理解对当前模型而言仍是一个重大挑战。

关键词

引用

@article{arxiv.2601.13024,
  title  = {Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses},
  author = {Chongyuan Dai and Yaling Shen and Jinpeng Hu and Zihan Gao and Jia Li and Yishun Jiang and Yaxiong Wang and Liu Liu and Zongyuan Ge},
  journal= {arXiv preprint arXiv:2601.13024},
  year   = {2026}
}

备注

24 pages, 10 figures, 9 Tables