CURE:文化理解与推理评估框架 - 面向LLM的“厚”文化对齐评估
计算与语言
2025-11-18 v1 人机交互
摘要
大型语言模型(LLM)日益部署于文化多样的环境中,但现有文化能力评估方法受限。现有方法聚焦去语境化的正确性或强制选择判断,忽视了针对恰当回应所需的文化理解与推理。为此,我们引入一组基准测试,不同直接探测抽象规范或孤立陈述的传统方法,转而提供现实情境情境,要求模型进行文化嵌入推理。除标准的Exact Match指标外,我们引入四个互补指标(Coverage、Specificity、Connotation、Coherence),以捕捉模型回应质量的不同维度。跨前沿模型的实证分析揭示,薄评估系统性高估文化能力,产生不稳定的评估与高方差。相比之下,厚评估暴露推理深度差异,降低方差,提供更稳定、可解释的文化理解信号。
引用
@article{arxiv.2511.12014,
title = {CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs},
author = {Truong Vo and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2511.12014},
year = {2025}
}
备注
7 pages, 5 figures