评估 LLM 对社会人口统计因素的适应:用户画像与对话历史
计算与语言
2025-05-28 v1 人工智能
人机交互
摘要
大型语言模型 (LLM) 的有效交互需要根据用户的社会人口统计特征(如年龄、职业和教育水平)调整回复。尽管许多现实应用利用对话历史进行上下文化,但现有对 LLM 行为适应的评估通常集中在单轮提示上。在本文中,我们提出了一个框架,用于评估当属性通过以下两种方式之一引入时的 LLM 适应情况:(1) 通过提示中的用户画像显式引入,或 (2) 通过多轮对话历史隐式引入。我们评估了模型行为在这些模态之间的一致性。使用多智能体流水线,我们构建了一个合成数据集,将对话历史与不同的用户画像配对,并采用价值观调查模块 (VSM 2013) (Hofstede and Hofstede, 2016) 中的问题来探测价值表达。我们的研究结果表明,大多数模型会根据人口统计特征的变化调整其表达的价值,特别是在年龄和教育水平方面,但一致性各不相同。具有更强推理能力的模型表现出更高的一致性,表明推理在稳健的社会人口统计适应中的重要性。
引用
@article{arxiv.2505.21362,
title = {Evaluating LLM Adaptation to Sociodemographic Factors: User Profile vs. Dialogue History},
author = {Qishuai Zhong and Zongmin Li and Siqi Fan and Aixin Sun},
journal= {arXiv preprint arXiv:2505.21362},
year = {2025}
}