中文

DenseAnnotate:通过口述描述实现图像和 3D 场景大规模稠密标注

计算机视觉与模式识别 2025-11-18 v1 计算与语言

摘要

随着多模态大语言模型(MLLM)在各类应用领域的快速采用,亟需任务导向的高质量训练数据。当前训练数据集的关键限制在于其依赖从互联网上挖掘或通过手动输入的稀疏标注,仅捕捉图像视觉内容的一小部分。稠密标注更为宝贵,但仍稀缺。传统基于文本的标注流程不适合创建稠密标注:输入限制了表述能力,减慢了标注速度,且未能代表细致的视觉特征,尤其是在多元文化图像和 3D 资产标注方面。本文提出 DenseAnnotate,一款基于音频的在线标注平台,使其能够高效地为图像和 3D 资产创建稠密、精细的标注。标注员在同步链接语音短语至图像区域或 3D 场景部件的同时,口述观察内容。我们的平台集成了语音识别转录和注意力区域标记功能。为演示 DenseAnnotate 的有效性,我们跨两个领域进行了超过 1000 名标注员的案例研究。我们构建了一个多模态数据集,包含 3531 张图像、898 个 3D 场景和 7460 个 3D 物体,包含 20 种语言的音频对齐稠密标注,包括 8746 条图像标题、2000 条场景标题和 19000 条物体标题。在该数据集上训练的模型在多语言能力上提升 5%,在文化对齐性上提升 47%,在 3D 空间能力上提升 54%。我们的结果表明,该平台为未来的视觉语言研究提供了可行的方法,可应用于各种任务和多样化的数据类型。

关键词

引用

@article{arxiv.2511.12452,
  title  = {DenseAnnotate: Enabling Scalable Dense Caption Collection for Images and 3D Scenes via Spoken Descriptions},
  author = {Xiaoyu Lin and Aniket Ghorpade and Hansheng Zhu and Justin Qiu and Dea Rrozhani and Monica Lama and Mick Yang and Zixuan Bian and Ruohan Ren and Alan B. Hong and Jiatao Gu and Chris Callison-Burch},
  journal= {arXiv preprint arXiv:2511.12452},
  year   = {2025}
}