开放场景理解:接地态势识别结合Segment Anything助力视障人士
计算机视觉与模式识别
2023-07-18 v1 人机交互
机器人学
图像与视频处理
摘要
接地态势识别(GSR)能够以符合上下文直觉的方式识别并解释视觉场景,产出图像中描绘的显著活动(动词)及所涉实体(角色)。在这项工作中,我们聚焦于GSR在辅助视障人士(PVI)中的应用。然而,为自信地导航周边环境并做出明智决策,通常要求检测对象的精确定位信息。我们首次提出了一种开放场景理解(OpenSU)系统,旨在生成所涉实体的像素级稠密分割掩码而非边界框。具体而言,我们在GSR基础上额外采用高效的Segment Anything Model(SAM)构建OpenSU系统。此外,为增强编码器-解码器结构间的特征提取与交互,我们使用坚实的纯Transformer骨干构建OpenSU系统以提升GSR性能。为加速收敛,我们将GSR解码器内的所有激活函数替换为GELU,从而缩短训练时长。在定量分析上,我们的模型在SWiG数据集上取得了最优性能。而且,通过在专用辅助技术数据集上的现场测试与应用演示,所提出的OpenSU系统可用于增强场景理解并促进视障人士的独立出行。我们的代码将发布于 https://github.com/RuipingL/OpenSU。
引用
@article{arxiv.2307.07757,
title = {Open Scene Understanding: Grounded Situation Recognition Meets Segment Anything for Helping People with Visual Impairments},
author = {Ruiping Liu and Jiaming Zhang and Kunyu Peng and Junwei Zheng and Ke Cao and Yufan Chen and Kailun Yang and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2307.07757},
year = {2023}
}
备注
Code will be available at https://github.com/RuipingL/OpenSU