LLM-GLOBE:评估大语言模型输出中嵌入文化价值观的基准
计算与语言
2024-11-12 v1
摘要
已有大量工作致力于最小化有害或偏见性生成内容的出现,并更好地将AI输出对齐人类意图;然而,关于大语言模型文化价值观的研究仍处于极早期阶段。文化价值观支撑着社会的运行,为洞察其成员的规范、优先事项及决策方式提供了深刻见解。鉴于此项研究的需求,本文依据文化心理学理论和经验证实的GLOBE框架,提出用于评估大语言模型文化价值体系的LLM-GLOBE基准测试,并利用该基准测试比较中美大语言模型的价值观。我们的 methodology 包括一种新颖的“LLMs-as-a-Jury”管道,对开放式内容进行自动化评估,以在概念层面实现大规模分析。结果阐明了东西方文化价值体系之间的相似性与差异性,并表明开放生成任务代表了评估文化价值观的更具前景的方向。我们解释了本研究对后续模型开发、评估和部署工作的意义,这些工作涉及大语言模型、更广泛的AI文化对齐,以及AI文化价值体系对人机协作结果的影响。
引用
@article{arxiv.2411.06032,
title = {LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output},
author = {Elise Karinshak and Amanda Hu and Kewen Kong and Vishwanatha Rao and Jingren Wang and Jindong Wang and Yi Zeng},
journal= {arXiv preprint arXiv:2411.06032},
year = {2024}
}