中文

DLLM Agent:看得更远,跑得更快

计算与语言 2026-03-23 v3

摘要

扩散大语言模型(DLLM)作为非自回归解码的替代方案,展现出令人瞩目的效率和建模属性,但其在智能体多步骤决策中的潜在影响仍未得到充分探索。我们提出具体问题:当生成范式改变而智能体框架和监督保持不变时,扩散 Backbone 是否导致规划和工具使用行为系统性差异?这些差异是否转化为端到端的效率收益?为此,我们在受控环境下,通过在相同智能体工作流程(DeepDiver)中实例化 DLLM 和 AR Backbone,并对相同轨迹数据进行匹配的智能体导向微调,得到基于扩散的 DLLM Agent 以及可直接比较的 AR Agent。跨越基准测试和案例研究,我们发现在相当相同准确率下,DLLM Agent 平均比 AR Agent 快 30% 以上,部分情况可实现 8 倍以上的加速。基于正确完成任务,DLLM Agent 还需更少的交互轮数和工具调用,符合其规划命中率更高的特征——即在正确动作路径上收敛更早,回溯更少。我们进一步识别了在工具使用智能体中部署扩散 Backbone 的两个实际考虑因素:首先,朴素的 DLLM 策略更容易发生结构化工具调用失败, necessitating 更强的工具调用专属训练以生成有效的 schema 和参数。其次,对于多轮输入交织上下文与动作跨度,扩散式 span 损坏需要对齐的注意力掩码以避免不正当的上下文-动作信息流;若无此对齐,性能将下降。最后,我们分析了不同工作流程阶段之间的注意力动态,观察到范式特定的协调模式,表明扩散 Backbone 智能体具有更强的全局规划信号。

关键词

引用

@article{arxiv.2602.07451,
  title  = {DLLM Agent: See Farther, Run Faster},
  author = {Huiling Zhen and Weizhe Lin and Renxi Liu and Kai Han and Yiming Li and Yuchuan Tian and Hanting Chen and Xiaoguang Li and Xiaosong Li and Chen Chen and Xianzhi Yu and Mingxuan Yuan and Youliang Yan and Peifeng Qin and Jun Wang and Yu Wang and Dacheng Tao and Yunhe Wang},
  journal= {arXiv preprint arXiv:2602.07451},
  year   = {2026}
}