注入环境描述以实现长视频语言定位
计算机视觉与模式识别
2024-08-07 v2 机器学习
摘要
本文研究了长视频语言定位(VLG)问题。给定一段长视频和一个自然语言查询,模型应时间定位精确回答查询的时刻。人类可以轻松解决 VLG 任务,即使面对任意长度的视频,也能通过利用从经验中获得的广泛而鲁棒的知识来丢弃无关时刻。与人类不同,现有的 VLG 方法容易陷入从小规模数据集中学到的表面线索,即使在无关帧中也是如此。为克服这一挑战,我们提出了 EI-VLG,一种利用多模态大语言模型(MLLM)提供的更丰富文本信息作为人类经验代理的 VLG 方法,帮助有效排除无关帧。我们通过在具有挑战性的 EgoNLQ 基准测试上的广泛实验验证了所提方法的有效性。
引用
@article{arxiv.2408.02336,
title = {Infusing Environmental Captions for Long-Form Video Language Grounding},
author = {Hyogun Lee and Soyeon Hong and Mujeen Sung and Jinwoo Choi},
journal= {arXiv preprint arXiv:2408.02336},
year = {2024}
}
备注
7 pages, 3 figures