DiffVAS:基于扩散模型的视觉主动搜索
计算机视觉与模式识别
2026-05-18 v1 人工智能
摘要
视觉主动搜索(VAS)已作为一种建模框架引入,用于利用视觉线索指导航空(如无人机)探索,并在广大地理区域内定位感兴趣区域。VAS的潜在应用包括检测罕见野生动物走私的热点、协助搜救任务,以及阴阳武器走私等。先前的VAS方法假设整个搜索空间提前已知,这往往不切实际 due to受限视野和高获取成本的限制;且通常针对特定目标对象学习策略,这限制了其同时搜索多个目标类别的能力。在本工作中,我们提出DiffVAS,一种目标条件策略,可根据任务要求在部分可观测环境中搜索多样化目标,推动视觉主动搜索策略在真实世界应用中的部署。DiffVAS利用扩散模型从依次观察的部分视角中重建整个地理区域,使基于目标的强化学习规划模块能够有效推理并指导后续搜索步骤。广泛实验表明,DiffVAS在部分可观测环境中搜索多样化目标方面显著优于领先方法,在多个数据集上取得显著超越。
引用
@article{arxiv.2605.15519,
title = {DiffVAS: Diffusion-Guided Visual Active Search in Partially Observable Environments},
author = {Anindya Sarkar and Srikumar Sastry and Aleksis Pirinen and Nathan Jacobs and Yevgeniy Vorobeychik},
journal= {arXiv preprint arXiv:2605.15519},
year = {2026}
}
备注
26 Pages, 12 figures, Accepted to AAMAS 2026