中文

面向社区价值观与常识的文化智能及价值观推断质量基准

软件工程 2025-12-08 v1 人工智能 人机交互

摘要

大型语言模型(LLM)已成为一种强大的技术,因此我们看到其在软件工程团队中的广泛采用与使用。大多数情况下,LLM 被设计为代表普通人群的“通用”技术。遗憾的是,这通常意味着其与占主导地位的西方白人叙事保持一致,而与参与协作创新的其他文化和人群不一致。为了应对这种不一致,近期出现了以开发“文化知情”LLM 为中心的努力,例如 ChatBlackGPT,它们能够更好地与历史上被边缘化的经历和观点保持一致。尽管取得了这些进展,但在支持我们开发和评估文化知情 LLM 的能力方面,仍鲜有努力。近期的一项工作提出了一种开发国家一致性基准的方法,强调与国家社会价值观和常识的一致性。然而,鉴于美国存在多样的文化认同,国家一致性基准对于更广泛的代表性而言是一个无效的目标。为了填补美国语境下的这一空白,我们提出一项重复研究,将用于开发 KorNAT(韩国国家 LLM 一致性基准)的过程转化为开发 CIVIQ,这是一个以与社区社会价值观和常识保持一致为中心的文化智能与价值观推断质量基准。我们的工作为旨在实践中实现 AI 技术文化一致性的研究与开发提供了关键基础。

关键词

引用

@article{arxiv.2512.05176,
  title  = {Towards A Cultural Intelligence and Values Inferences Quality Benchmark for Community Values and Common Knowledge},
  author = {Brittany Johnson and Erin Reddick and Angela D. R. Smith},
  journal= {arXiv preprint arXiv:2512.05176},
  year   = {2025}
}

备注

Under review