RS-Net:用于动态场景图生成的上下文感知关系评分
计算机视觉与模式识别
2025-11-13 v1 人工智能
摘要
动态场景图生成(Dynamic Scene Graph Generation, DSGG)模型描述了视频中对象关系随时间的演变。然而,现有方法仅在标注的对象对上进行训练,缺乏对非相关对象对的指导,导致在推理阶段难以识别有意义的关系。本文提出关系评分网络(RS-Net),一个模块化框架,用于基于空间相互作用和长程时序上下文对对象对的上下文重要性进行评分。RS-Net由具备可学习上下文标记的空间上下文编码器和聚合视频级信息的时序编码器组成。得到的关系得分被整合到统一的三元组评分机制中,以增强关系预测。RS-Net可以轻松集成到现有DSGG模型中,无需架构更改。在Action Genome数据集上的实验表明,RS-Net在各种基线模型上 consistently提高了召回率和精确率,在平均召回率方面取得显著提升,凸显了其处理关系长尾分布的能力。尽管参数数量增加,RS-Net仍保持竞争的效率,超越了最先进的方法。
引用
@article{arxiv.2511.08651,
title = {RS-Net: Context-Aware Relation Scoring for Dynamic Scene Graph Generation},
author = {Hae-Won Jo and Yeong-Jun Cho},
journal= {arXiv preprint arXiv:2511.08651},
year = {2025}
}