中文

探索视觉语言模型在风格对齐中的极限

计算与语言 2025-10-01 v1 人工智能

摘要

视觉语言模型正在越来越多地用于生成特定风格的图像描述,如幽默或浪漫。然而,这些基于转换器的模型在零样本设置下常常在这一主观任务上感到困难。虽然可以利用偏好数据将其对齐到所需风格,但这种数据获取成本高昂,限制了探索模型完整能力的潜力。本文通过研究小型视觉语言模型对幽默和浪漫风格进行对齐的数据效率,这一方法有助于定义这些模型的性能极限,并确定实现风格饱和所需的最少偏好数据,以对其能力和局限性进行基准测试。

关键词

引用

@article{arxiv.2509.25568,
  title  = {Probing the Limits of Stylistic Alignment in Vision-Language Models},
  author = {Asma Farajidizaji and Akash Gupta and Vatsal Raina},
  journal= {arXiv preprint arXiv:2509.25568},
  year   = {2025}
}

备注

5 pages, 1 figure, 3 tables