MOSA:面向动态场景图生成的运动引导语义对齐
计算机视觉与模式识别
2026-04-22 v1
摘要
动态场景图生成(DSGG)旨在对视频序列中的物体及其动态交互进行结构化建模,以实现高层语义理解。然而,现有方法在细粒度关系建模、语义表征利用以及尾部关系建模能力方面仍存在困难。为解决这些问题,本文提出了一种面向 DSGG 的运动引导语义对齐方法。首先,运动特征提取器(MFE)对物体对的距离、速度、运动持久性和方向一致性等运动属性进行编码。然后,通过运动引导交互模块(MIM)将这些运动属性与空间关系特征融合,以生成运动感知关系表征。为进一步增强语义判别能力,跨模态动作语义匹配(ASM)机制将视觉关系特征与关系类别的文本嵌入进行对齐。最后,引入类别加权损失策略以强调对尾部关系的学习。大量严格的测试表明,MoSA 在 Action Genome 数据集上表现最优。
引用
@article{arxiv.2604.19631,
title = {MOSA: Motion-Guided Semantic Alignment for Dynamic Scene Graph Generation},
author = {Xuejiao Wang and Bohao Zhang and Changbo Wang and Gaoqi He},
journal= {arXiv preprint arXiv:2604.19631},
year = {2026}
}