中文

ConsistencyAI:评估LLMs针对不同人口统计学群体的事实一致性基准

计算与语言 2025-10-30 v2 人工智能 人机交互

摘要

当不同人群的提问者问同一问题时,LLM是否会给你提供不同于我答案的事实?本文引入ConsistencyAI,一个独立于LLM提供方的基准,用于衡量大语言模型(LLM)在不同人格(persona)下的事实一致性。ConsistencyAI测试当用户来自不同人口统计学背景时,模型是否会对相同问题给出事实不一致的回答。本基准在LLM提供方参与的情况下设计,提供公正的评估与问责。在我们的实验中,我们对19个LLM施以包含15个话题、每个话题5个事实的提示,并对每个LLM重复执行100次查询,每一次都添加来自代表总体人口的子集中不同人格的提示上下文。我们将响应处理为句子嵌入,计算跨人格的余弦相似度,并计算跨人格余弦相似度的加权平均,以计算事实一致性得分。在100人格实验中,得分范围为0.9065至0.7896,平均值为0.8656,我们将其作为基准阈值。xAI的Grok-3最具一致性,而多个轻量级模型排名最低。一致性随话题而异:职业市场最不一致,G7世界领导人最一致,疫苗或以色列-巴勒斯坦冲突等议题因提供商而异。这些结果表明,提供商和话题都影响事实一致性。我们公开代码和交互式演示,以支持可重复的评估,并鼓励开发面向人格不变性的提示策略。

关键词

引用

@article{arxiv.2510.13852,
  title  = {ConsistencyAI: A Benchmark to Assess LLMs' Factual Consistency When Responding to Different Demographic Groups},
  author = {Peter Banyas and Shristi Sharma and Alistair Simmons and Atharva Vispute},
  journal= {arXiv preprint arXiv:2510.13852},
  year   = {2025}
}

备注

For associated code repository, see http://github.com/banyasp/consistencyAI For user-friendly web app, see http://v0-llm-comparison-webapp.vercel.app/