LLM人格诱导中的评估漂移:我们在移动目标吗?
计算与语言
2026-05-19 v1
摘要
大型语言模型能否可靠地表达类似人的人格,或仅仅是在没有稳定底层配置的情况下模拟表面线索?为检验这一问题,我们通过在长篇散文上进行微调来诱导人格,其中每篇散文与目标 Big Five 人格配置相关联。随后,我们使用 IPIP-NEO 问卷评估所诱导人格的稳定性和忠实度。具体询问:(i) 事后训练(SFT、DPO、ORPO)是否在提示重新措辞下稳定问卷得分,(ii) 能否从无指导散文中诱导目标 Big Five 配置?我们的结果表明,微调一致地减少了在五个模型之间对问卷响应方差,直接缓解了在预训练模型中报告的评估脆弱性。然而,这种新的稳定性揭示了更根本的局限性:即使单一特征得分改善,完整五维配置上的准确率仍接近随机水平。这表明,无指导散文缺乏可靠人格表达所必需的线索。我们因此呼吁采用情景导向数据集或交互式诱导,该方法通过累积 test-aligned 证据来实现。
引用
@article{arxiv.2605.16996,
title = {Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?},
author = {Prateek Rajput and Yewei Song and Iyiola E. Olatunji and Jacques Klein and Tegawendé F. Bissyandé},
journal= {arXiv preprint arXiv:2605.16996},
year = {2026}
}
备注
14 pages, 8 main pages, 5 figures, 4 main page figures