中文

开放场景理解:接地态势识别结合Segment Anything助力视障人士

计算机视觉与模式识别 2023-07-18 v1 人机交互 机器人学 图像与视频处理

摘要

接地态势识别(GSR)能够以符合上下文直觉的方式识别并解释视觉场景,产出图像中描绘的显著活动(动词)及所涉实体(角色)。在这项工作中,我们聚焦于GSR在辅助视障人士(PVI)中的应用。然而,为自信地导航周边环境并做出明智决策,通常要求检测对象的精确定位信息。我们首次提出了一种开放场景理解(OpenSU)系统,旨在生成所涉实体的像素级稠密分割掩码而非边界框。具体而言,我们在GSR基础上额外采用高效的Segment Anything Model(SAM)构建OpenSU系统。此外,为增强编码器-解码器结构间的特征提取与交互,我们使用坚实的纯Transformer骨干构建OpenSU系统以提升GSR性能。为加速收敛,我们将GSR解码器内的所有激活函数替换为GELU,从而缩短训练时长。在定量分析上,我们的模型在SWiG数据集上取得了最优性能。而且,通过在专用辅助技术数据集上的现场测试与应用演示,所提出的OpenSU系统可用于增强场景理解并促进视障人士的独立出行。我们的代码将发布于 https://github.com/RuipingL/OpenSU。

关键词

引用

@article{arxiv.2307.07757,
  title  = {Open Scene Understanding: Grounded Situation Recognition Meets Segment Anything for Helping People with Visual Impairments},
  author = {Ruiping Liu and Jiaming Zhang and Kunyu Peng and Junwei Zheng and Ke Cao and Yufan Chen and Kailun Yang and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2307.07757},
  year   = {2023}
}

备注

Code will be available at https://github.com/RuipingL/OpenSU