中文

CaptionSmiths:灵活控制图像描述中的语言模式

计算机视觉与模式识别 2025-07-03 v1

摘要

图像描述模型能够灵活切换其语言模式(例如描述性和长度)将非常有用,因为它可以应用于各种各样的应用场景。然而,尽管生成式视觉语言模型取得了显著的进步,但对生成描述属性的细粒度控制并不容易实现,这主要归因于两个原因:(i) 现有模型在训练时未被给定属性作为条件;(ii) 现有模型无法在一个状态平滑地过渡到另一个状态。鉴于这一挑战,我们提出了一种新方法,CaptionSmiths,以获得能够处理多种语言模式的单一描述模型。首先,我们的方法将每个描述的三个属性(长度、描述性和词汇唯一性)量化为连续标量值,而无需人工标注。基于这些值,我们通过表示两个端点向量之间的插值来表示条件,例如一个用于非常短的描述,另一个用于非常长的描述。实验结果表明,所得模型能够平滑地改变输出描述的属性,并显示出优于基线方法的更高词汇对齐度。例如,CaptionSmiths在控制描述长度方面的误差降低了506%,同时实现了更好的词汇对齐。代码将在https://github.com/omron-sinicx/captionsmiths 上提供。

关键词

引用

@article{arxiv.2507.01409,
  title  = {CaptionSmiths: Flexibly Controlling Language Pattern in Image Captioning},
  author = {Kuniaki Saito and Donghyun Kim and Kwanyong Park and Atsushi Hashimoto and Yoshitaka Ushiku},
  journal= {arXiv preprint arXiv:2507.01409},
  year   = {2025}
}

备注

Accepted to ICCV2025