中文

CCBENCH:通过健康查询中的隐式信号规范评估大语言模型的文化能力

计算机与社会 2026-06-08 v1 人工智能 计算与语言

摘要

为了公平且不带刻板印象地与用户互动,AI 模型必须展现文化能力,即推断并适应用户隐式信号化的文化价值观的能力,而非依赖静态的人口统计学特征。我们引入 CCBENCH,一个用于评估大语言模型(LLM)文化能力的框架,将文化视为规范遵循状态的连续体,而非文化归属的二元状态。作为健康领域的案例研究,我们创建了 CCBENCH-Health,其中包含 60 个基于理论构建的人物角色,在六种文化中展现出不同的规范遵循状态,每个角色参与 18 段现实对话。每个人物角色在 52 个取自真实用户论坛的医疗保健问题上进行评估,产生了 3,120 次独特交互。对五个领先模型的基准测试显示,即使是最佳模型,也只有 20-30% 的时间能给出文化上恰当的回答。当明确提示模型关注对话历史中的文化相关线索(CoT)时,性能平均仅适度提升 3-5%。我们发现,当人物角色回避文化规范而非遵循规范时,模型表现最佳,这揭示了一种持续的不对称性,表明模型更倾向于与内置偏见对齐,而非适应文化线索。这一点在阿富汗语境中尤为明显(平均:8.8%),其中文化线索很少能产生恰当的健康建议。最后,我们发现模型有时更容易适应隐式的文化对话风格,而非明确陈述的文化实践,尽管这因文化而异。

关键词

引用

@article{arxiv.2607.05405,
  title  = {CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries},
  author = {Vasudha Varadarajan and Akhila Yerukola and Mona T. Diab and Maarten Sap},
  journal= {arXiv preprint arXiv:2607.05405},
  year   = {2026}
}

备注

34 pages