中文

揭示隐形:通过隐喻对视频进行描述

计算机视觉与模式识别 2024-10-03 v2 人工智能 计算与语言

摘要

隐喻是我们日常生活中常用的沟通工具。虽然文本形式的隐喻的检测和生成已被广泛研究,但其他形式的隐喻研究不足。最近的研究表明,视觉语言 (VL) 模型无法理解表情包和广告中的视觉隐喻。目前尚无针对涉及复杂语言现象如隐喻的视频进行探针性研究的工作。因此,我们在本工作中引入一种新的 VL 任务,即描述视频中存在的隐喻。为促进这一新任务,我们构建并发布了一个由 705 个视频和 2115 个人工撰写的描述组成的手动创建数据集,同时提出一种新的指标称为平均概念距离 (ACD),用于自动评估生成隐喻的创意性。我们还提出一种新的低资源视频隐喻描述系统:GIT-LLaVA,该系统在该任务上获得了与最先进技术相当的性能。我们对现有视频语言模型在该任务上的表现进行了全面分析,并发布了数据集、模型和基准结果,以便进一步研究。

关键词

引用

@article{arxiv.2406.04886,
  title  = {Unveiling the Invisible: Captioning Videos with Metaphors},
  author = {Abisek Rajakumar Kalarani and Pushpak Bhattacharyya and Sumit Shekhar},
  journal= {arXiv preprint arXiv:2406.04886},
  year   = {2024}
}