SemCo:面向语义连贯的视觉关系预测
计算机视觉与模式识别
2025-11-19 v2 人工智能
摘要
视觉关系预测(VRF)旨在不观测未来视觉内容的情况下预测物体间的关系。该任务依赖于捕获和建模物体交互中的语义连贯性,因为这构成了视频中事件与场景演化的基础。然而,现有的 VRF 数据集由于数据集中标注噪声以及主客体对中不同动作与关系转换之间的弱相关性,对学习的此类连贯性支持有限。此外,现有方法难以区分相似关系,并过拟合于连续帧中不变的关系。为应对这些挑战,我们提出 SemCoBench,一个强调视觉关系预测中语义连贯性的基准。基于动作标签和短期主客体对,SemCoBench 通过清理和重组视频数据集来分解关系类别与动态,以确保预测物体交互中的语义连贯性。此外,我们还提出语义连贯 Transformer 方法(SemCoFormer),通过关系增强模块(RAM)和连贯推理模块(CRM)来建模语义连贯性。RAM 用于区分相似关系,CRM 促使模型关注关系中的动态变化。在 SemCoBench 上的实验结果表明,建模语义连贯性是迈向合理、细粒度且多样的视觉关系预测的关键一步,有助于更全面地理解视频场景。
关键词
引用
@article{arxiv.2107.01181,
title = {SemCo: Toward Semantic Coherent Visual Relationship Forecasting},
author = {Yangjun Ou and Yao Liu and Li Mi and Zhenzhong Chen},
journal= {arXiv preprint arXiv:2107.01181},
year = {2025}
}