中文

基于 Koopman 视角的视频序列自监督分解、解耦与动态解释性预测

计算机视觉与模式识别 2021-10-04 v1

摘要

人类对世界的解释包含使用符号对感官输入进行分类并以层次化方式组合。计算机视觉与人工智能的长期目标之一是赋予机器如我们一般结构化与解释世界的能力。朝此目标,近期方法已能自监督地将视频序列分解并解耦为组成对象与动态。然而,对场景动态赋予解释的研究甚少。我们提出一种方法,将视频分解为运动对象及其属性,并通过 Koopman 嵌入借助线性系统辨识工具建模各对象动态。这允许利用 Koopman 算子 K 对各异对象的动态进行解释、操控与外推。我们在多个合成数据集上测试了方法,并成功在解释动态的同时预测了具挑战性的轨迹。

关键词

引用

@article{arxiv.2110.00547,
  title  = {Self-Supervised Decomposition, Disentanglement and Prediction of Video Sequences while Interpreting Dynamics: A Koopman Perspective},
  author = {Armand Comas and Sandesh Ghimire and Haolin Li and Mario Sznaier and Octavia Camps},
  journal= {arXiv preprint arXiv:2110.00547},
  year   = {2021}
}