中文

大语言模型人格测量中的持久不稳定:规模、推理与对话历史的影响

图形学 2025-11-06 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

大型语言模型需要保持一致的行为模式以实现安全部署,但存在大量变异的迹象,可能导致这些模型在人格特征表达方面不稳定。我们提出了 PERSIST(PERsonality Stability in Synthetic Text),一个综合性的评估框架,测试了 25 个开源模型(参数量从 1B 到 685B)并生成超过 200 万条响应。使用传统(BFI、SD3)和新型 LLM 适应人格问卷,我们系统性地变化模型规模、人格、推理模式、问题顺序或改写、以及对话历史。我们的发现挑战了基本假设:(1)问题重新排序本身即可引入人格测量的大幅偏移;(2)规模扩大提供的稳定性收益有限,即使是 400B+ 模型也在 5 分尺度上表现出 >0.3 的标准差;(3)被期望能稳定行为的干预措施,如推理和包含对话历史,反而可能增加变异性;(4)详细的人格指令产生的效果混合,其中 misaligned 人格显示出显著高于 helpful assistant 基准的变异性;(5)尽管 LLM 适应问卷虽提高了生态有效性,但仍表现出与人类中心版本相当的不稳定性。这跨尺度和各种缓解策略的持久不稳定性表明当前的 LLM lacks 架构基础以实现真正的行为一致性。对于需要可预测行为的安全关键应用,这些发现表明当前的对齐策略可能不足。

关键词

引用

@article{arxiv.2508.04825,
  title  = {Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off},
  author = {Seungyong Lee and Jeong-gi Kwak},
  journal= {arXiv preprint arXiv:2508.04825},
  year   = {2025}
}

备注

Accepted to SIGGRAPH Asia 2025, project page: https://nxnai.github.io/Voost/