中文

通过遮罩轨迹实现交互导向视频生成

机器学习 2025-10-14 v2

摘要

生成表现出人类或机器人与物体相互作用的视频对于具身智能至关重要,因为它们提供了丰富且多样化的视觉先验,用于机器人学习、操纵策略训练和功能推理。然而,现有方法往往难以建模此类复杂且动态的相互作用。虽然最近的研究表明,遮罩可作为有效的控制信号并提升生成质量,但获取密集且精确的遮罩标注在实际应用中仍是一个主要挑战。为克服这一限制,我们引入Mask2IV,一个专为交互导向视频生成而设计的新型框架。它采用解耦的两阶段管道,首先预测演员和物体的合理运动轨迹,然后以这些轨迹为条件生成视频。该设计无需用户提供密集遮罩输入,同时保留对相互作用过程的灵活操控。此外,Mask2IV支持灵活且直观的控制,允许用户指定相互作用的目标物体,并通过动作描述或空间位置线索引导运动轨迹。为支持系统化的训练和评估,我们精选了两个基准数据集,涵盖人类-物体相互作用和机器人操纵场景中的多样化动作和物体类别。大量实验表明,我们的方法在视觉真实性和可操控性方面优于现有基线方法。

关键词

引用

@article{arxiv.2510.03134,
  title  = {Enhancing XAI Narratives through Multi-Narrative Refinement and Knowledge Distillation},
  author = {Flavio Giorgi and Matteo Silvestri and Cesare Campagnano and Fabrizio Silvestri and Gabriele Tolomei},
  journal= {arXiv preprint arXiv:2510.03134},
  year   = {2025}
}