中文

ISR-DPO:通过迭代自省直接偏好优化对齐视频大语言模型

计算机视觉与模式识别 2025-01-09 v2

摘要

迭代式自我改进,这一概念已超越个人成长,在机器学习中找到了强大的应用,特别是在将弱模型转变为强模型方面。虽然自然语言处理领域的最新进展已通过迭代偏好优化证明了其有效性,但由于模态错位,将这种方法应用于视频大语言模型(VLMM)仍然具有挑战性。VLMM在迭代偏好建模过程中难以应对这种错位,因为自我评判模型通常优先考虑语言知识而非视觉信息。此外,由于自我奖励循环中的长度偏差,迭代偏好优化可能导致产生视觉幻觉的冗长响应。为了解决这些问题,我们提出了迭代自省直接偏好优化(ISR-DPO),一种利用自省来增强偏好建模的方法。该方法增强了自我评判对信息性视频区域的关注,从而产生更基于视觉的偏好。在跨多种视频问答基准的广泛实证评估中,ISR-DPO显著优于现有技术。我们致力于开源我们的代码、模型和数据集,以鼓励进一步的研究。

关键词

引用

@article{arxiv.2406.11280,
  title  = {ISR-DPO: Aligning Large Multimodal Models for Videos by Iterative Self-Retrospective DPO},
  author = {Daechul Ahn and Yura Choi and San Kim and Youngjae Yu and Dongyeop Kang and Jonghyun Choi},
  journal= {arXiv preprint arXiv:2406.11280},
  year   = {2025}
}

备注

AAAI 2025