中文

InterEdit:导航文本导导的多人 3D 动作编辑

计算机视觉与模式识别 2026-03-16 v1 机器人学 图像与视频处理

摘要

文本导导的 3D 动作编辑在单人场景中取得了成功,但由于受限的配对数据和人际相互作用的复杂性,向多人场景的扩展研究较少。我们提出了多人 3D 动作编辑任务,即从源动作和文本指令生成目标动作。为支持这一任务,我们提出了 InterEdit3D,一个包含手动两人动作变更标注的新数据集,并构建了 Text-guided Multi-human Motion Editing(TMME)基准。我们 presented InterEdit,一种用于 TMME 的同步分类自由扩散模型。它引入了语义感知计划标记对齐(Semantic-Aware Plan Token Alignment),使用可学习标记捕获高层次互动线索,以及基于 DCT 和能量池化的互动感知频率标记对齐策略,以建模周期性动作动力学。实验表明,InterEdit 在文本到动作一致性和编辑保真度方面均取得改进,实现了 TMME 的最先进水平。该数据集和代码将发布于 https://github.com/YNG916/InterEdit。

关键词

引用

@article{arxiv.2603.13082,
  title  = {InterEdit: Navigating Text-Guided Multi-Human 3D Motion Editing},
  author = {Yebin Yang and Di Wen and Lei Qi and Weitong Kong and Junwei Zheng and Ruiping Liu and Yufan Chen and Chengzhi Wu and Kailun Yang and Yuqian Fu and Danda Pani Paudel and Luc Van Gool and Kunyu Peng},
  journal= {arXiv preprint arXiv:2603.13082},
  year   = {2026}
}

备注

The dataset and code will be released at https://github.com/YNG916/InterEdit