中文

ICCV23 视觉对话情感解释挑战:SEU_309 团队技术报告

计算机视觉与模式识别 2024-07-16 v1 人工智能

摘要

视觉对话情感解释生成挑战赛聚焦于通过视觉对话互动生成艺术讨论中的情感解释。我们的做法结合了最先进的多模态模型,包括语言模型 (LM) 和大型视觉语言模型 (LVLM),以实现卓越的性能。通过利用这些模型,我们超越了现有基准,在 ICCV23 视觉对话情感解释生成挑战赛中夺得第一名,该挑战赛是第 5 届在视觉与语言之间关闭循环工作坊 (CLCV) 的一部分,在 F1 和 BLEU 指标上取得显著分数。我们的方法在生成准确的情感解释方面表现出色,推动了对艺术情感影响的理解。

关键词

引用

@article{arxiv.2407.09760,
  title  = {ICCV23 Visual-Dialog Emotion Explanation Challenge: SEU_309 Team Technical Report},
  author = {Yixiao Yuan and Yingzhe Peng},
  journal= {arXiv preprint arXiv:2407.09760},
  year   = {2024}
}