中文

关于使用调查问题评估LLM可信度的探讨

计算与语言 2026-02-05 v1 人工智能 计算机与社会

摘要

最近的研究通过改编社会调查表来评估大语言模型(LLM)的价值取向,通常通过对模型施以调查问题并将其响应与人类平均响应进行比较。本文识别了该方法的局限性,具体取决于具体设置,可能导致对价值取向相似性的低估或高估。我们以世界价值调查为例,在三种语言和五个国家中进行实证检验,表明提示方法(直接式 vs. 链式思考)和解码策略(贪婪式 vs. 采样式)对结果具有显著影响。为评估答案之间的相互作用,我们引入一种新型指标——自相关距离。该指标衡量LLM在不同问题下的响应关系是否保持一致,如人类之此。我们的发现表明,即便平均与人类数据高度一致,仅就LLM响应独立地考虑,并不保证其响应在结构上与人类一致。此外,我们还揭示了两种常见评估指标(均方距离和KL散度)之间的弱相关,这两种指标均假设调查答案彼此独立。针对未来研究,我们建议采用链式思考提示、基于采样的解码策略(需进行数十次采样),以及包括自相关距离在内的多指标分析。

关键词

引用

@article{arxiv.2602.04033,
  title  = {On the Credibility of Evaluating LLMs using Survey Questions},
  author = {Jindřich Libovický},
  journal= {arXiv preprint arXiv:2602.04033},
  year   = {2026}
}

备注

Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures