在3D场景中生成上下文感知的自然答案
计算机视觉与模式识别
2023-10-31 v1
摘要
3D问答是3D视觉-语言中一个尚待探索的新兴领域。先前方法局限于预定义答案空间,无法自然地生成答案。在本工作中,我们将问答任务转向序列生成任务,以生成3D场景中问题的自由形式自然答案(Gen3DQA)。为此,我们直接在语言奖励上优化模型以确保全局句子语义。此处我们还采用语用语言理解奖励进一步提升句子质量。我们的方法在ScanQA基准上确立了新的SOTA(测试集CIDEr分数72.22/66.57)。
引用
@article{arxiv.2310.19516,
title = {Generating Context-Aware Natural Answers for Questions in 3D Scenes},
author = {Mohammed Munzer Dwedari and Matthias Niessner and Dave Zhenyu Chen},
journal= {arXiv preprint arXiv:2310.19516},
year = {2023}
}