ValueFlow:测量多智能体大语言模型系统中价值扰动的传播
多智能体系统
2026-05-29 v2 计算与语言
摘要
多智能体大语言模型(LLM)系统日益由相互观察和回应彼此输出的智能体组成。虽然价值对齐通常针对孤立模型进行评估,但价值扰动如何通过智能体交互传播仍知之甚少。我们提出了 ValueFlow,一个基于扰动的框架,通过源自施瓦茨价值观调查的 56 个价值观评估数据集,并使用 LLM 作为评判者的协议对智能体价值取向进行评分,来测量多智能体系统中的价值漂移。ValueFlow 将价值漂移分解为智能体级别的响应行为与系统级别的结构效应,由两个指标捕获:β-敏感性,即智能体对受扰同伴价值信号的敏感度;以及系统敏感性(SS),即节点级扰动对最终系统输出的影响。实验跨越了价值维度、骨干模型、角色设定和拓扑结构,表明敏感性在不同价值间差异显著,并深受交互结构的影响,这表明多智能体系统中的价值对齐是一个系统级属性,而不仅仅是智能体级属性。因此,ValueFlow 为审计和缓解已部署多智能体系统中的价值传播提供了原则性基础。
引用
@article{arxiv.2602.08567,
title = {ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems},
author = {Jinnuo Liu and Chuke Liu and Hua Shen},
journal= {arXiv preprint arXiv:2602.08567},
year = {2026}
}
备注
Preprint. Under review. 28 pages, 10 figures