中文

SymDPO: 利用符号示范直接偏好优化增强大型多模态模型的上下文学习

计算机视觉与模式识别 2024-11-26 v2

摘要

随着语言模型规模的持续扩大,大语言模型 (LLM) 在上下文学习 (ICL) 中展现出涌现能力,使其能够通过在上下文中添加少量上下文示范 (ICD) 来解决语言任务。受这些进展启发,研究人员将这些技术扩展到具有 ICL 能力的大型多模态模型 (LMM)。然而,现有的 LMM 面临一个关键问题:它们往往无法有效利用多模态示范中的视觉上下文,而是简单地遵循文本模式。这表明 LMM 未能实现多模态示范与模型输出之间的有效对齐。为了解决这个问题,我们提出了符号示范直接偏好优化 (SymDPO)。具体而言,SymDPO 旨在打破构建多模态示范的传统范式,使用随机符号替换实例中的文本答案。这迫使模型仔细理解示范图像,并建立图像与符号之间的关系以正确回答问题。我们在多个基准上验证了该方法的有效性,证明通过 SymDPO,LMM 能够更有效地理解示例中的多模态上下文,并利用这些知识更好地回答问题。代码可在 https://github.com/APiaoG/SymDPO 获取。

关键词

引用

@article{arxiv.2411.11909,
  title  = {SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization},
  author = {Hongrui Jia and Chaoya Jiang and Haiyang Xu and Wei Ye and Mengfan Dong and Ming Yan and Ji Zhang and Fei Huang and Shikun Zhang},
  journal= {arXiv preprint arXiv:2411.11909},
  year   = {2024}
}