中文

VaseVQA-3D:釆器希腊陶瓷的 3D 视觉问答基准

计算机视觉与模式识别 2025-10-14 v2

摘要

视觉语言模型(VLMs)在多模态理解任务中取得了显著进展,尤其在通用任务如图像描述和视觉推理方面表现出强大的能力。然而,在处理专门的文化遗产领域如 3D 陶器雕像时,现有模型面临数据稀缺和领域知识不足的严峻挑战。由于缺乏针对性训练数据,当前 VLMs 难以有效处理此类具有文化意义的专业任务。为此,我们提出 VaseVQA-3D 数据集,作为最初的用于古希腊陶瓷分析的 3D 视觉问答数据集,收集了 664 个古希腊陶瓶 3D 模型及其对应的问答数据,并建立了完整的数据构建管道。我们进一步开发了 VaseVLM 模型,通过领域自适应训练提升模型在陶器分析中的性能。实验结果验证了我们方法的有效性,在 VaseVQA-3D 数据集上,R@1 指标提升 12.8%,词汇相似度提升 6.6%,显著提高了对 3D 陶器雕像的识别与理解,为数字化遗产保护研究提供了新的技术路径。代码:https://github.com/AIGeeksGroup/VaseVQA-3D。网站:https://aigeeksgroup.github.io/VaseVQA-3D。

关键词

引用

@article{arxiv.2510.04479,
  title  = {VaseVQA-3D: Benchmarking 3D VLMs on Ancient Greek Pottery},
  author = {Nonghai Zhang and Zeyu Zhang and Jiazi Wang and Yang Zhao and Hao Tang},
  journal= {arXiv preprint arXiv:2510.04479},
  year   = {2025}
}