中文

MTI:一种面向AI代理的基于行为的性情画像系统

人工智能 2026-04-03 v1 计算与语言

摘要

能力相当的AI模型可以表现出根本不同的行为模式,但尚不存在用于测量这些倾向性差异的标准化工具。现有方法要么借用人类人格维度并依赖自我报告(这与LLM中的实际行为存在偏差),要么将行为变化视为缺陷而非特质。我们提出了模型性情指数(MTI),一种基于行为的画像系统,从四个维度测量AI代理的性情:反应性(环境敏感性)、合规性(指令-行为一致性)、社会性(关系资源分配)和韧性(抗压能力)。MTI以模型医学中的四壳模型为基础,测量代理的实际行为而非其自我描述,采用两阶段结构化检验协议将能力与倾向性分离。我们对10个小语言模型(1.7B-9B参数,6个机构,3种训练范式)进行了画像,并报告了五项主要发现:(1)四个维度在指令微调模型中基本独立(所有|r| < 0.42);(2)维度内侧面解离得到实证确认——合规性分解为完全独立的正式和立场侧面(r = 0.002),而韧性分解为反向相关的认知和对抗侧面;(3)合规性-韧性悖论揭示了意见产出和事实脆弱性通过独立通道运作;(4)RLHF不仅通过改变维度得分而且通过创建未对齐基础模型中不存在的维度内侧面分化来重塑性情;(5)性情与模型大小(1.7B-9B)无关,确认MTI测量的是倾向性而非能力。

关键词

引用

@article{arxiv.2604.02145,
  title  = {MTI: A Behavior-Based Temperament Profiling System for AI Agents},
  author = {Jihoon Jeong},
  journal= {arXiv preprint arXiv:2604.02145},
  year   = {2026}
}

备注

29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)