中文

人工印象:通过特质印象的视角评估大语言模型行为

计算与语言 2025-10-13 v1

摘要

我们提出并研究人工印象——大语言模型对提示词的内部表征中那些类似于人类基于语言形成的印象与刻板印象的模式。我们在生成的提示词上拟合线性探针,以根据二维刻板印象内容模型(SCM)预测印象。利用这些探针,我们研究了印象与下游模型行为之间的关系,以及可能影响此类印象的提示词特征。我们发现,大语言模型在收到提示时 inconsistently 报告印象,但印象从其隐藏表征中线性解码的结果更为一致。此外,我们表明提示词的人工印象可以预测模型回答的质量以及模糊措辞(hedging)的使用情况。我们还研究了提示词中特定内容、风格和方言特征如何影响大语言模型的印象。

关键词

引用

@article{arxiv.2510.08915,
  title  = {Artificial Impressions: Evaluating Large Language Model Behavior Through the Lens of Trait Impressions},
  author = {Nicholas Deas and Kathleen McKeown},
  journal= {arXiv preprint arXiv:2510.08915},
  year   = {2025}
}

备注

EMNLP 2025 Camera Ready