中文

具象化图像描述:基于自监督学习的代理人

计算机视觉与模式识别 2025-09-18 v2 机器人学

摘要

我们提出一种自监督方法,以提高代理人在描述任意对象时能力的同时,主动探索通用环境。这是一项具有挑战性的任务,因为当前模型在不同摄像机视角和杂乱环境下难以获得连贯的图像描述。我们提出了一个三阶段框架,对现有的描述模型进行微调,通过共识机制提高描述准确度和一致性。首先,代理人探索环境,收集带噪声的图像-描述对。然后,通过共识机制和大型语言模型,从而为每个对象实例提炼出一致的伪描述。最后,使用这些伪描述对现有的描述模型进行微调,并加入对比学习。我们分析了描述模型、探索策略、伪标签方法和微调策略的组合效果,在手动标记的测试集上进行评估。结果表明,某些策略可以训练出从而从古典基线方法中挖掘出更高的样本 disagreement。我们的方法在所有策略下,都与其他现有方法相比,在语义相似性方面表现更好,微调显著提高了描述的准确度和一致性。代码和测试集标注均可在 https://hsp-iit.github.io/embodied-captioning/ 获取。

关键词

引用

@article{arxiv.2504.08531,
  title  = {Embodied Image Captioning: Self-supervised Learning Agents for Spatially Coherent Image Descriptions},
  author = {Tommaso Galliena and Tommaso Apicella and Stefano Rosa and Pietro Morerio and Alessio Del Bue and Lorenzo Natale},
  journal= {arXiv preprint arXiv:2504.08531},
  year   = {2025}
}

备注

11 pages, 8 figures, 6 tables, code and test set annotations available at https://hsp-iit.github.io/embodied-captioning/