中文

解决长视频字幕中的ID匹配挑战

计算机视觉与模式识别 2025-10-09 v1

摘要

为长而复杂的视频生成字幕既关键又具有挑战性,对不断增长的文本到视频生成和多模态理解领域具有重大意义。长视频字幕中的一个关键挑战是准确识别出现在不同帧中的同一人,我们称之为ID匹配问题。很少有先前工作聚焦于这一重要问题。那些已有的工作通常泛化能力有限,并且依赖于逐点匹配,这限制了它们的整体有效性。在本文中,与先前方法不同,我们基于LVLMs来利用其强大的先验知识。我们旨在释放LVLMs本身固有的ID匹配能力,以增强字幕的ID匹配性能。具体而言,我们首先引入了一个新的基准来评估视频字幕的ID匹配能力。使用该基准,我们研究了包含GPT-4o的LVLMs,揭示了关键洞察:ID匹配性能可以通过两种方法提升:1)增强图像信息的使用和2)增加个体描述的信息量。基于这些洞察,我们提出了一种新的视频字幕方法,称为RICE(有效字幕中的身份识别)。包括字幕质量和ID匹配性能评估在内的广泛实验证明了我们方法的优越性。特别值得注意的是,在GPT-4o上实现时,我们的RICE将ID匹配的精确度从50%提升至90%,将ID匹配的召回率从15%提升至80%。RICE使得在长视频字幕中持续追踪不同个体成为可能。

关键词

引用

@article{arxiv.2510.06973,
  title  = {Addressing the ID-Matching Challenge in Long Video Captioning},
  author = {Zhantao Yang and Huangji Wang and Ruili Feng and Han Zhang and Yuting Hu and Shangwen Zhu and Junyan Li and Yu Liu and Fan Cheng},
  journal= {arXiv preprint arXiv:2510.06973},
  year   = {2025}
}