一种灵活的方法用于衡量人类与人工智能之间的对齐程度——基于表征相似性分析
人工智能
2025-10-03 v3
摘要
在我们考虑将大型语言模型(LLM)赋予关键社会和决策角色时,衡量其与人类认知的对齐度变得至关重要。这需要能够评估这些系统如何表示信息,并在多样化任务中促进与人类理解的比较。为满足这一需求,我们采用了表征相似性分析(RSA)方法,这是一种使用两两相似度评估来量化AI与人类对齐程度的方法。我们将其应用于文本和图像模态上的语义对齐,测量不同的大型语言模型(LLM)和视觉语言模型(VLM)的相似度判断如何与人类响应在群体和个体水平上对齐。我们测试的模型中,GPT-4o在与人类表现最强的对齐度, particularly when leveraging its text processing capabilities rather than image processing, regardless of the input modality。然而,我们研究的模型都未能充分捕捉人类参与者中观察到的个体差异,仅在一定程度上与任何单个人的响应相吻合。这一方法帮助我们发现了某些超参数和提示词,能够引导模型行为在个体或群体层面具有更或更少的人类化特征。两两评估和RSA能够高效且灵活地量化人类与AI之间的对齐度,这补充了现有的基于准确性的基准任务。我们展示了这种方法在多个模态(单词、句子、图像)中的实用性,用于理解LLMs如何编码知识,以及检验其表征与人类认知的对齐程度。
引用
@article{arxiv.2412.00577,
title = {A Flexible Method for Behaviorally Measuring Alignment Between Human and Artificial Intelligence Using Representational Similarity Analysis},
author = {Mattson Ogg and Ritwik Bose and Jamie Scharf and Christopher Ratto and Michael Wolmetz},
journal= {arXiv preprint arXiv:2412.00577},
year = {2025}
}