中文

PinpointQA:室内视频中小对象中心化空间理解的数据集与基准

计算机视觉与模式识别 2026-05-15 v2 人工智能

摘要

室内视频中的小对象中心化空间理解仍是多模态大语言模型(MLLMs)面临的重大挑战,尽管其在对象搜索和助理应用方面具有实际价值。尽管已有基准推进了视频空间智能、具身推理和诊断感知,但尚无基准直接评估模型是否能够在视频中定位目标对象并以足够精确的方式表达其位置以供后续使用。本文介绍PinpointQA——面向室内视频中小对象中心化空间理解的数据集与基准。基于ScanNet++和ScanNet200构建的PinpointQA包含1,024个场景和10,094对QA配对,组织为四个逐步增加难度的任务:目标存在验证(TPV)、最近参考标识(NRI)、细粒度空间描述(FSD)和结构化空间预测(SSP)。该数据集基于中间空间表示构建,QA配对通过自动生成后经质量控制进一步精炼。代表性MLLM的实验揭示了沿着逐步递增难度链条的持续能力差距,尤其是SSP仍然 Particularly difficult。对PinpointQA的监督式微调可在尤其是较难任务上实现显著提升,表明PinpointQA既是诊断基准也是有效的训练数据集。数据集和项目页面可在https://rainchowz.github.io/PinpointQA 访问。

关键词

引用

@article{arxiv.2604.08991,
  title  = {PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos},
  author = {Zhiyu Zhou and Peilin Liu and Ruoxuan Zhang and Luyang Zhang and Cheng Zhang and Hongxia Xie and Wen-Huang Cheng},
  journal= {arXiv preprint arXiv:2604.08991},
  year   = {2026}
}