中文

跨文化情境下大语言模型情节道德生成的文化对齐性评估

计算与语言 2026-04-13 v1 人工智能

摘要

情节是跨文化传递价值观的关键方式,但其解释在不同的语言和文化语境中各不相同。因此,我们提出了多语言情节道德生成作为一种新型文化嵌入评估任务。使用一个新收集的跨 14 种语言-文化对的的人类撰写情节道德数据集,我们通过语义相似性、人类偏好调查和价值分类比较模型输出与人类解释。我们表明,诸如 GPT-4o 和 Gemini 等前沿模型生成的情节道德与人类响应在语义上相似且受人类评估者偏好。然而,它们的输出在跨语言方差方面明显小于人类输出,并集中于较窄的一组广泛共享的价值观。这表明,尽管当代模型可以近似人类道德解释的中心倾向,但它们在再现人类叙事理解所特有的多样性方面仍有挑战。通过将叙事解释框架定为评估任务,本工作引入了一种新的方法,用于研究语言模型 beyond 静态基准或基于知识的测试的文化对齐性。

关键词

引用

@article{arxiv.2604.08797,
  title  = {Lessons Without Borders? Evaluating Cultural Alignment of LLMs Using Multilingual Story Moral Generation},
  author = {Sophie Wu and Andrew Piper},
  journal= {arXiv preprint arXiv:2604.08797},
  year   = {2026}
}