中文

面向高效图像探索与用户引导图像字幕的可视分析

计算机视觉与模式识别 2023-11-03 v1

摘要

预训练大规模语言-图像模型的最新进展开启了视觉理解的新纪元,带来了显著飞跃。这些突破尤其有助于解决以往令人望而却步的长期挑战。利用这些创新技术,本文攻克可视分析领域中两个众所周知的问题:(1)大规模图像数据集的高效探索及其内部潜在数据偏见的识别;(2)图像字幕的评估及其生成过程的引导。一方面,通过可视地检视语言-图像模型为某图像数据集自动生成的字幕,我们深入洞察视觉内容的语义基础,发掘数据集中可能根深蒂固的数据偏见。另一方面,通过刻画视觉内容与文本字幕间的关联,我们暴露了预训练语言-图像模型在字幕能力上的弱点,并提出了引导字幕生成的交互界面。两部分已融合为一个协同的可视分析系统,促进视觉与文本元素的相互丰富。我们通过基于大规模图像数据集的具体案例研究,与领域从业者一同验证了系统的有效性。

关键词

引用

@article{arxiv.2311.01016,
  title  = {Visual Analytics for Efficient Image Exploration and User-Guided Image Captioning},
  author = {Yiran Li and Junpeng Wang and Prince Aboagye and Michael Yeh and Yan Zheng and Liang Wang and Wei Zhang and Kwan-Liu Ma},
  journal= {arXiv preprint arXiv:2311.01016},
  year   = {2023}
}