中文

AD3:隐式动作是世界模型区分多样视觉干扰项的关键

机器学习 2024-06-06 v2 计算机视觉与模式识别

摘要

基于模型的方法在区分视觉控制任务中无关的干扰项方面取得了显著进展。然而,先前的研究主要聚焦于异构干扰项,如带有噪声的背景视频,留下了与可控智能体高度相似的同构干扰项未被充分探索,这对现有方法构成了重大挑战。为解决此问题,我们提出了隐式动作生成器(Implicit Action Generator, IAG),用于学习视觉干扰项的隐式动作,并提出一种新算法,即基于隐式动作信息的多样化视觉干扰项区分器(implicit Action-informed Diverse visual Distractors Distinguisher, AD3),该算法利用IAG推断的动作来训练分离的世界模型。隐式动作有效捕捉了背景干扰项的行为,有助于区分任务无关的组成部分,使智能体能够在任务相关的状态空间内优化策略。我们的方法在包含异构和同构干扰项的各种视觉控制任务中取得了优异性能。IAG学习的隐式动作在实际中的必不可少作用也得到了实证验证。

关键词

引用

@article{arxiv.2403.09976,
  title  = {AD3: Implicit Action is the Key for World Models to Distinguish the Diverse Visual Distractors},
  author = {Yucen Wang and Shenghua Wan and Le Gan and Shuai Feng and De-Chuan Zhan},
  journal= {arXiv preprint arXiv:2403.09976},
  year   = {2024}
}