关于使用调查问题评估LLM可信度的探讨
计算与语言
2026-02-05 v1 人工智能
计算机与社会
摘要
最近的研究通过改编社会调查表来评估大语言模型(LLM)的价值取向,通常通过对模型施以调查问题并将其响应与人类平均响应进行比较。本文识别了该方法的局限性,具体取决于具体设置,可能导致对价值取向相似性的低估或高估。我们以世界价值调查为例,在三种语言和五个国家中进行实证检验,表明提示方法(直接式 vs. 链式思考)和解码策略(贪婪式 vs. 采样式)对结果具有显著影响。为评估答案之间的相互作用,我们引入一种新型指标——自相关距离。该指标衡量LLM在不同问题下的响应关系是否保持一致,如人类之此。我们的发现表明,即便平均与人类数据高度一致,仅就LLM响应独立地考虑,并不保证其响应在结构上与人类一致。此外,我们还揭示了两种常见评估指标(均方距离和KL散度)之间的弱相关,这两种指标均假设调查答案彼此独立。针对未来研究,我们建议采用链式思考提示、基于采样的解码策略(需进行数十次采样),以及包括自相关距离在内的多指标分析。
引用
@article{arxiv.2602.04033,
title = {On the Credibility of Evaluating LLMs using Survey Questions},
author = {Jindřich Libovický},
journal= {arXiv preprint arXiv:2602.04033},
year = {2026}
}
备注
Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures