中文

TaskGround:面向全场景家庭推理的结构化可执行任务推断

人工智能 2026-05-19 v1 计算机视觉与模式识别 机器人学

摘要

在真实的家庭部署中,家庭智能体通常必须在完整的家庭场景和情境化的家庭请求下运作,而非基于干净的任务规范。此类请求要求智能体识别与任务相关的实体、恢复预期的任务条件,并从周围的场景上下文中解析顺序约束。我们将这种能力形式化为全场景家庭推理:给定一个完整的家庭场景和情境化的家庭请求,智能体必须在生成接地的技能级动作序列之前,推断出可执行的任务结构。这一设定具有挑战性,因为完整的家庭场景包含大量与任务无关的信息,使得直接的完整场景提示低效且容易出错。在实际部署中,这一挑战进一步被隐私和本地计算约束所放大,这些约束倾向于具有有限长上下文推理能力的紧凑型开放权重模型。我们提出了 TaskGround,一个无需训练且与模型无关的 Ground-Infer-Execute 框架,该框架将完整场景接地为紧凑的与任务相关的场景切片,推断可执行的任务结构,并将其编译为接地的技能级动作序列。为了评估这一设定,我们引入了 FullHome,这是一个包含 400 项家庭任务的人工验证评估套件,涵盖多样化的家庭规模环境以及面向目标和过程约束的需求。在 FullHome 上,TaskGround 在专有模型和开放权重模型上均大幅提高了任务成功率。值得注意的是,它使得 Qwen3.5-9B 在直接完整场景提示下的表现可与 GPT-5 相媲美,同时将总输入 token 成本最多降低了 18 倍。我们的结果将可执行任务结构推断确定为全场景家庭推理的核心瓶颈,并表明结构化接地可以使紧凑的本地模型在实际家庭部署中更加有效。

关键词

引用

@article{arxiv.2605.18109,
  title  = {TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning},
  author = {ZhiYuan Feng and Yu Deng and Ruichuan An and Zhenhua Liu and Qixiu Li and Keming Wu and Zhiying Du and Weijie Wang and Haoxiao Wang and Shuang Chen and Sicheng Xu and Yaobo Liang and Jiaolong Yang and Baining Guo},
  journal= {arXiv preprint arXiv:2605.18109},
  year   = {2026}
}

备注

Project page: https://aaronfengzy.github.io/TaskGround/