中文

主动式智能体是否真的需要LLM来决定何时唤醒以及锚定什么?

计算与语言 2026-05-29 v1 人工智能 人机交互

摘要

主动式智能体读取用户活动作为文本,并在每次事件上调用LLM以决定是否采取行动。但用户活动并非原生文本:它是由操作系统维护的结构化事件流 (actor, verb, object, timestamp) 元组,而且该系统已经以图形式保存了这些数据。将结构化数据渲染为文本并要求LLM恢复其结构是一种系统本不需要进行的往返。我们将始终打开的信号视为图更新,而不是文本,并使用小型时序图学习 (TGL) 模型作为编码器:一次前向传播即可获得每个事件的触发概率和每个实体的路由得分,只有当触发器触发时,才调用下游智能体(将小型结构化数据转化为流畅的用户面向句子),而这一步才是LLM调用。TGL在每个14个背bone模型上的F1分数均有所提升(平均提升16.7,最高提升46.0);在触发器架构比较中,一个TGL检查点给出最强的触发器AUC以及最稳定的部署阈值。在GPU服务器上每事件运行11.13毫秒,在消费级笔记本电脑上运行13.99毫秒,速度是每个被测试 regimes 中每个单前向 LLM 作为触发器配置的4--7倍和12--83倍,约220 MiB BF16 的驻留内存可部署在与其消费的隐私敏感活动流一起部署在设备上。

关键词

引用

@article{arxiv.2605.30152,
  title  = {Do Proactive Agents Really Need an LLM to Decide When to Wake and What to Anchor?},
  author = {Xiaoze Liu and Ruowang Zhang and Amir H. Abdi and Michel Galley and Zhikai Chen and Siheng Xiong and Xiaoqian Wang and Jing Gao},
  journal= {arXiv preprint arXiv:2605.30152},
  year   = {2026}
}

备注

31 pages, 5 figures, 7 tables