中文

AWARE-US:面向工具调用智能体的偏好感知不可行性解决

人工智能 2026-03-03 v2

摘要

查询结构化数据库的工具调用对话式智能体常面临两个相互关联的失败:欠指定 (缺少实现精确查询所需的约束) 和不可行性 (完全指定的查询返回空集)。先前系统常以 "无结果" 响应,或采用 ad hoc 方式进行松弛,这可能通过丢弃高度重要的要求来违反用户意图。我们将不可行性处理建模为偏好感知的查询修复:当查询不可满足时,智能体应松弛最不重要的约束。我们提出三种基于 LLM 的方法从对话中推断约束相对重要性:(1) 局部加权、(2) 全局单次加权、(3) 两两排序。通过大量实验在汽车推荐任务中,采用监督微调和直接偏好优化训练的局部加权方法在用户偏好对齐方面最佳 (48%),而全局加权实现最高的正确松弛准确率 (56%);三种方法均优于先前不可行性解决基线。我们还引入 AWARE-US,一个包含 120+ 个以人设为基础的查询的数据集,要求智能体 (i) 通过对话消除基请求的歧义 (ii) 以符合人设隐含偏好的方式解决不可行性。代码请参见 Github: https://github.com/mhtkrmz/Infeasible-task,数据集可在 Hugging Face 上获取

关键词

引用

@article{arxiv.2601.02643,
  title  = {AWARE-US: Preference-Aware Infeasibility Resolution in Tool-Calling Agents},
  author = {Mehmet Kurmaz},
  journal= {arXiv preprint arXiv:2601.02643},
  year   = {2026}
}

备注

22 pages, 5 figures, 6 tables