阅读提示之间的内容:刻度如何塑造 LLM 的隐式个人化
计算与语言
2025-09-17 v2
摘要
生成式大语言模型(LLM)会从对话中的细微线索推断用户的民族信息——这一现象称为隐式个人化。先前的研究表明,这类推断可能导致针对被假设属于少数族裔用户的回复质量下降,即使未提供任何民族信息。本文通过使用受控的人工合成对话,系统性地探讨 LLM 对刻度线索的响应方式,通过分析模型的内部状态以及针对特定用户问题生成的答案来揭示其潜在的用户表示。我们的发现表明,LLM 确实会基于这些刻度信号推断民族属性,而对于许多群体,即使用户明确表示与不同民族群体相符,这种推断仍然 persists。最后,我们表明,通过对模型内部表示使用经过训练的线性探针进行干预,可有效缓解这种以刻度为导向的隐式个人化。我们的结果凸显了在 LLM 如何表示用户身份方面需要更加透明和可控。
引用
@article{arxiv.2505.16467,
title = {Reading Between the Prompts: How Stereotypes Shape LLM's Implicit Personalization},
author = {Vera Neplenbroek and Arianna Bisazza and Raquel Fernández},
journal= {arXiv preprint arXiv:2505.16467},
year = {2025}
}
备注
Accepted at EMNLP Main 2025