量化与缓解 LLM 中的社会可取性回应:基于可选强制选择心理测量研究
计算与语言
2026-04-29 v2 统计方法学
摘要
人类自报问卷在 NLP 中日益用于对大语言模型(LLM)进行基准测试与审计,从人物一致性到安全性和偏见评估等。然而,这些工具 presume 诚实回应;在评估情境中,LLM 可能倾向于社会偏好答案——这是一种社会可取性回应(SDR),偏向问卷派生分数与下游结论。我们提出了量化与缓解 LLM 中 SDR 的心理测量框架。为量化 SDR,同一问卷在 HONEST 与 FAKE-GOOD 指示下分别实施,计算 SDR 为来自项目反应理论(IRT)估计的潜在得分的方向校正标准化效应大小。这使我们能够在不同构建和回应格式之间进行比较,以及对照人类 instructed-faking 標準。为缓解,我们通过受约束优化从项目池中选取 30 对跨领域配对,以匹配可取性构建了graded forced-choice(GFC)大五人格问卷。在针对九个 instruction-following LLM 在带有已知目标轮廓的合成人物上评估时,Likert 风格问卷显示出持续的大型 SDR,而可取性匹配的 GFC 则显著减轻了 SDR,同时基本保持了对意图人物轮廓的恢复。这些结果凸显了模型依赖的 SDR 恢复权衡,动员 SDR 感知的报告实践,以进行 LLM 的问卷基准测试与审计。
引用
@article{arxiv.2602.17262,
title = {Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study},
author = {Kensuke Okada and Yui Furukawa and Kyosuke Bunji},
journal= {arXiv preprint arXiv:2602.17262},
year = {2026}
}