中文

CURE:文化理解与推理评估框架 - 面向LLM的“厚”文化对齐评估

计算与语言 2025-11-18 v1 人机交互

摘要

大型语言模型(LLM)日益部署于文化多样的环境中,但现有文化能力评估方法受限。现有方法聚焦去语境化的正确性或强制选择判断,忽视了针对恰当回应所需的文化理解与推理。为此,我们引入一组基准测试,不同直接探测抽象规范或孤立陈述的传统方法,转而提供现实情境情境,要求模型进行文化嵌入推理。除标准的Exact Match指标外,我们引入四个互补指标(Coverage、Specificity、Connotation、Coherence),以捕捉模型回应质量的不同维度。跨前沿模型的实证分析揭示,薄评估系统性高估文化能力,产生不稳定的评估与高方差。相比之下,厚评估暴露推理深度差异,降低方差,提供更稳定、可解释的文化理解信号。

关键词

引用

@article{arxiv.2511.12014,
  title  = {CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs},
  author = {Truong Vo and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2511.12014},
  year   = {2025}
}

备注

7 pages, 5 figures