通过整体三维场景理解生成视觉空间描述
计算机视觉与模式识别
2023-05-26 v2 计算与语言
摘要
视觉空间描述(VSD)旨在生成描述图像中给定物体空间关系的文本。现有的VSD工作仅对二维几何视觉特征进行建模,因此不可避免地陷入目标物体空间理解偏差的问题。在本工作中,我们研究将三维场景特征引入VSD。借助外部三维场景提取器,我们获取输入图像的三维物体与场景特征,并基于此构建以目标物体为中心的三维空间场景图(Go3D-S2G),从而在整体三维场景中对目标物体的空间语义进行建模。此外,我们提出一种场景子图选择机制,从Go3D-S2G中采样拓扑多样的子图,利用多样的局部结构特征引导生成空间多样化的文本。在两个VSD数据集上的实验结果表明,我们的框架显著优于基线方法,尤其在具有复杂视觉空间关系的样本上提升明显。同时,我们的方法能够产生更具空间多样性的生成结果。代码已发布于 https://github.com/zhaoyucs/VSD。
引用
@article{arxiv.2305.11768,
title = {Generating Visual Spatial Description via Holistic 3D Scene Understanding},
author = {Yu Zhao and Hao Fei and Wei Ji and Jianguo Wei and Meishan Zhang and Min Zhang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2305.11768},
year = {2023}
}
备注
ACL 2023