自适应视觉场景理解:增量式场景图生成
计算机视觉与模式识别
2024-11-04 v4
摘要
场景图生成(SGG)分析图像以提取关于物体及其关系的有意义信息。在动态视觉世界中,AI 系统持续检测新物体并建立其与已有物体的关系至关重要。近期,大量研究聚焦于目标检测与图像识别领域的持续学习。然而,关注 SGG 中更具挑战性持续学习问题的研究有限。这一难度的提升源于物体间复杂的交互与动态关系及其相关上下文。因此,在持续学习中,SGG 模型常需在自适应视觉场景理解过程中扩展、修改、保留并推理场景图。为系统探索持续场景图生成(CSEGG),我们提出一个包含三种学习机制的综合基准:关系增量、场景增量与关系泛化。此外,我们引入一种名为 RAS 的“通过合成分析进行回放”方法。该方法利用场景图,将其分解与重组以表示不同场景,并基于这些组合式场景图回放合成场景。回放的合成场景作为一种在已知与未知环境中练习并精炼 SGG 熟练度的方式。实验结果不仅凸显了直接将现有持续学习方法与 SGG 主干结合的挑战,也展示了我们所提方法的有效性,在提升 CSEGG 效率的同时兼顾隐私与内存占用。所有数据与源代码均已在线公开。
引用
@article{arxiv.2310.01636,
title = {Adaptive Visual Scene Understanding: Incremental Scene Graph Generation},
author = {Naitik Khandelwal and Xiao Liu and Mengmi Zhang},
journal= {arXiv preprint arXiv:2310.01636},
year = {2024}
}