中文

Ego-InBetween:基于 ego-centric 视频的对象状态转换生成

计算机视觉与模式识别 2026-04-21 v1

摘要

理解物理转换过程对于人类认知和人工智能系统都是至关重要的,尤其是从以 ego-centric 视角进行,这在行动建模中作为人类与机器之间的关键桥梁。我们将这种建模过程定义为 Egocentric Instructed Visual State Transition(EIVST),即在简短的动作指令下,生成 depict object transformations 于初始和目标状态之间的所有中间帧。EIVST 为当前生成模型带来两个挑战:(1)理解初始和目标状态的视觉场景,并从 ego-centric 视角推理转换步骤;(2)生成符合给定指令且在两个视觉状态之间保持对象外观一致性的连贯中间转换。为此,我们提出 EgoIn 框架。该框架首先通过 TransitionVLM 推断两个给定状态之间多步转换过程,该模型在我们精选的数据集上微调,以更好地适应此任务并减少幻觉信息。随后,基于由 Transition Conditioning 模块生成的转换条件,生成帧序列。此外,我们引入了对象感知辅助监督,以在转换过程中保持对象外观的一致性。广泛的实验在人类-对象和机器人-对象交互数据集上表明,EgoIn 在生成语义上有意义且视觉上连贯的转换序列方面表现优异。

关键词

引用

@article{arxiv.2604.17749,
  title  = {Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos},
  author = {Mengmeng Ge and Takashi Isobe and Xu Jia and Yanan Sun and Zetong Yang and Weinong Wang and Dong Zhou and Dong Li and Huchuan Lu and Emad Barsoum},
  journal= {arXiv preprint arXiv:2604.17749},
  year   = {2026}
}

备注

CVPR2026