RelWitness:基于视觉-几何关系证词的开放词汇 3D 场景图生成
计算机视觉与模式识别
2026-05-22 v2
摘要
开放词汇 3D 场景图生成旨在以灵活的自然语言谓词描述对象实例及其关系。核心难点不仅是词汇扩展,更是监督可靠性:3D 场景图数据集中的关系标注有限,许多有效的对象-对关系未被标注。我们提出 RelWitness,一个基于 posed RGB-D 序列的开放词汇 3D 场景图生成框架,面向不完整关系监督。核心概念是关系证词:使关系在捕获的场景中可见的具体视觉-几何线索。支持关系需要接触和垂直排序;包含关系需要包围;接近关系需要度量距离;方向关系需要面向方向;稳定关系应在两个对象均可见的视角中持续存在。RelWitness 从 RGB 视图、深度图、重建的 3D 几何、角色敏感文本、对象先验空视图以及多视图一致性构建关系证词记录。一个视觉-几何证词验证器将未标注的关系候选分配给已验证的缺失阳性、可靠阴性或不确定的未标注情况。随后采用 witness-guided positive-unlabeled 目标从不完整标注中学习,而不会将每个缺失标签转化为阴性。我们进一步引入 witness-consistent 解码和一个 RGB-D 缺失关系审计协议。模拟的 manuscript-planning 实验在 3DSSG/3RScan 和 ScanNet 派生的开放词汇分割上显示出预期行为: improved 未见关系识别、更高 witness 精度、更低幻觉率以及减少冗余关系短语。所有数值结果均为 planning values,需在提交前替换为复现测量值。
引用
@article{arxiv.2605.20823,
title = {RelWitness: Open-Vocabulary 3D Scene Graph Generation with Visual-Geometric Relation Witnesses},
author = {Minh Anh Nguyen and Quang Huy Tran and Bao Ngoc Le and Tuan Kiet Pham and Sui Yang Guang},
journal= {arXiv preprint arXiv:2605.20823},
year = {2026}
}