中文

跨模态身份映射:通过强化学习最小化模态转换中的信息损失

计算机视觉与模式识别 2026-03-03 v1 人工智能

摘要

大型视觉语言模型(LVLMs)常常忽略或误表述关键视觉内容。最小化此类信息损失将迫使 LVLMs 关注图像细节以生成精确描述。然而,由于视觉内容与文本输出之间的模态鸿沟,测量模态转换期间的信息损失是天然具有挑战性的。在本文中,我们认为图像标题的质量与通过该标题进行文本检索检索到的图像相似性呈正相关。基于此洞察,我们进一步提出 Cross-modal Identity Mapping(CIM),一个在不 requiring additional annotations 的情况下增强图像标题生成的强化学习框架。具体而言,该方法从两个角度量化信息损失:Gallery Representation Consistency 和 Query-gallery Image Relevance。在这些指标下监督,LVLM 最小化信息损失,旨在实现从图像到标题的身份映射。实验结果表明,我们的方法在图像标题生成中表现优异,即使与监督微调(SFT)相比较。在 COCO-LN500 数据集上,CIM 对 Qwen2.5-VL-7B 实现了 20% 的关系推理提升。代码将在论文接受后发布。

关键词

引用

@article{arxiv.2603.01696,
  title  = {Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning},
  author = {Haonan Jia and Shichao Dong and Xin Dong and Zenghui Sun and Jin Wang and Jinsong Lan and Xiaoyong Zhu and Bo Zheng and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2603.01696},
  year   = {2026}
}

备注

Accepted by CVPR 2026