通过主动选择与重新标注提升 3D VQA 表现
计算机视觉与模式识别
2025-08-19 v2
摘要
3D 视觉问答(3D VQA) 是实现模型感知物理世界并进行空间推理的关键任务。在 3D VQA 中,答案的自由形式常导致不当标注,这会在训练整个数据集时使模型产生困惑或误导。虽然其他文本生成任务可通过在大规模数据集上学习来缓解此问题,但 3D 场景数据稀缺加剧了误导性标注的负面影响。虽然主动学习策略可选择有价值实例进行训练,但未能识别和解决误导性标签,而这在实际中不可避免地由 oracle 提供。为此,我们提出了一种多轮交互式主动学习策略。该策略基于模型的语义不确定性选择数据,以更有效地构建坚实的知识基础,主动请求 oracle 重新标注以解决潜在的误导性标签。对于不确定性评估,我们利用基于方差的度量,考虑术语之间的语义关系,从而避免以往评估度量对类别间相似性的统一假设。大量实验表明,该方法在模型性能和训练成本方面均表现更佳,实现相对高精度所需的训练成本减半。代码已公开于 https://github.com/fz-zsl/AQuA。
引用
@article{arxiv.2507.04630,
title = {Learn 3D VQA Better with Active Selection and Reannotation},
author = {Shengli Zhou and Yang Liu and Feng Zheng},
journal= {arXiv preprint arXiv:2507.04630},
year = {2025}
}
备注
13 pages, 16 figures, accepted by ACM MM 2025