中文

当代理看起来相同:量化工具使用行为中的蒸馏诱导相似性

计算与语言 2026-04-24 v1

摘要

模型蒸馏是大语言模型代理快速进步的主要驱动力,但往往导致行为趋同。许多新兴代理共享 nearly identical 的推理步骤和错误模式,这表明它们可能是来自几位主导教师的蒸馏副本。现有指标然而无法区分对任务成功必需的行为与反映模型自主偏好的非必需模式。我们提出两种互补的指标来隔离非必需行为模式:用于 verbal alignment(语言对齐)的 "响应模式相似性"(Response Pattern Similarity, RPS)和用于建模为有向图的工具使用习惯的 "动作图相似性"(Action Graph Similarity, AGS)。在针对 Claude Sonnet 4.5(thinking)在 τ\tau-Bench 和 τ2\tau^2-Bench 上评估 18 个来自 8 个提供商的模型时,我们发现,在-family 模型对在 AGS 中得分比 cross-family 对高出 5.9 pp,且 Kimi-K2(thinking)达到 SnodeS_{\text{node}} 的 82.6% 和 SdepS_{\text{dep}} 的 94.7%,超过 Anthropic 自己的 Opus 4.1。受控蒸馏实验进一步确认 AGS 区分教师特定收敛与一般性改进。RPS 和 AGS 捕获不同的行为维度(Pearson rr = 0.491),为代理生态系统中的行为趋同提供互补诊断信号。我们的代码已公开于 https://github.com/Syuchin/AgentEcho。

关键词

引用

@article{arxiv.2604.21255,
  title  = {When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors},
  author = {Chenghao Yang and Yuning Zhang and Zhoufutu Wen and Tao Gong and Jiaheng Liu and Qi Chu and Nenghai Yu},
  journal= {arXiv preprint arXiv:2604.21255},
  year   = {2026}
}

备注

Accepted by ACL 2026 Main Conference