中文

恶魔藏于 EOS:详细图像描述的序列训练

计算机视觉与模式识别 2025-08-22 v2 计算与语言

摘要

尽管视觉语言模型 (VLM) 在图像描述方面取得了显著进展,但图像描述常常缺乏细节,基准模型会生成短而笼统的描述。尽管已提出监督数据和复杂奖励函数以改进详细图像描述,但我们发现根本性问题在于:模型对结束符 (EOS) 标记的偏好,这种偏好在交叉熵训练期间被引入。我们提出了一种无监督方法来消除模型过早预测 EOS 标记的偏好。通过减少这种偏好,我们鼓励生成更长、更详细的描述,而无需复杂的奖励函数或监督。我们的方法简单、有效且易于应用于任何预训练模型。通过在三个 VLM 和三个详细描述基准测试上的实验,我们展示了其有效性。结果显示,描述长度和相关细节显著增加,尽管也出现了预期的幻觉率增加。

关键词

引用

@article{arxiv.2507.20077,
  title  = {The Devil is in the EOS: Sequence Training for Detailed Image Captioning},
  author = {Abdelrahman Mohamed and Yova Kementchedjhieva},
  journal= {arXiv preprint arXiv:2507.20077},
  year   = {2025}
}

备注

Accepted to COLM 2025