See It All:面向 3D 密集描述的上下文感知后期聚合
计算机视觉与模式识别
2024-08-15 v1 计算与语言
摘要
3D 密集描述是一项在 3D 场景中定位物体并为每个物体生成描述性句子的任务。3D 密集描述中的近期方法采用了来自目标检测的 Transformer 编码器-解码器框架,以构建无需手工设计组件的全端到端流水线。然而,这些方法在处理矛盾目标时存在困难,即单个查询注意力必须同时关注紧密定位的物体区域和上下文环境。为克服这一挑战,我们引入了 SIA(See-It-All),一种采用后期聚合新范式的 Transformer 流水线。SIA 同时解码两组查询——上下文查询和实例查询。实例查询专注于定位和物体属性描述,而上下文查询灵活地捕获多个物体之间或与全局场景的感兴趣区域,随后通过简单的基于距离的措施进行后期聚合。为进一步提升上下文感知描述生成的质量,我们设计了一种新型聚合器,基于周围上下文、全局环境和物体实例生成信息充分的描述。在两个最广泛使用的 3D 密集描述数据集上的大量实验表明,我们提出的方法相比先前方法取得了显著提升。
引用
@article{arxiv.2408.07648,
title = {See It All: Contextualized Late Aggregation for 3D Dense Captioning},
author = {Minjung Kim and Hyung Suk Lim and Seung Hwan Kim and Soonyoung Lee and Bumsoo Kim and Gunhee Kim},
journal= {arXiv preprint arXiv:2408.07648},
year = {2024}
}
备注
Accepted to ACL 2024 Findings