中文

DiffVAS:基于扩散模型的视觉主动搜索

计算机视觉与模式识别 2026-05-18 v1 人工智能

摘要

视觉主动搜索(VAS)已作为一种建模框架引入,用于利用视觉线索指导航空(如无人机)探索,并在广大地理区域内定位感兴趣区域。VAS的潜在应用包括检测罕见野生动物走私的热点、协助搜救任务,以及阴阳武器走私等。先前的VAS方法假设整个搜索空间提前已知,这往往不切实际 due to受限视野和高获取成本的限制;且通常针对特定目标对象学习策略,这限制了其同时搜索多个目标类别的能力。在本工作中,我们提出DiffVAS,一种目标条件策略,可根据任务要求在部分可观测环境中搜索多样化目标,推动视觉主动搜索策略在真实世界应用中的部署。DiffVAS利用扩散模型从依次观察的部分视角中重建整个地理区域,使基于目标的强化学习规划模块能够有效推理并指导后续搜索步骤。广泛实验表明,DiffVAS在部分可观测环境中搜索多样化目标方面显著优于领先方法,在多个数据集上取得显著超越。

关键词

引用

@article{arxiv.2605.15519,
  title  = {DiffVAS: Diffusion-Guided Visual Active Search in Partially Observable Environments},
  author = {Anindya Sarkar and Srikumar Sastry and Aleksis Pirinen and Nathan Jacobs and Yevgeniy Vorobeychik},
  journal= {arXiv preprint arXiv:2605.15519},
  year   = {2026}
}

备注

26 Pages, 12 figures, Accepted to AAMAS 2026