基于多智能体冲突的范围感知视频时刻检索
计算机视觉与模式识别
2025-11-04 v1 人工智能
摘要
视频时刻检索使用文本查询从给定的未剪辑视频中定位时刻。使用文本查询定位相应的视频时刻有助于人们高效地与视频交互。当前解决方案未考虑不同模型结果之间的位置冲突,导致各种模型无法正确集成以产生更好的结果。本研究引入了基于强化学习的视频时刻检索模型,该模型可一次扫描整个视频以查找时刻的边界,同时生成其位置证据。此外,我们提出了多智能体系统框架,可使用证据学习来解决代理人定位输出之间的冲突。作为观察和处理代理人之间冲突的一个副产品,我们可以在无需额外训练的情况下决定查询在视频中是否没有对应的时刻(超出范围),这适用于实际应用。广泛的基准数据集上的实验表明,我们提出的方法有效。此外,本研究的结果表明,建模多智能体系统的竞争和冲突是提高时刻检索中 RL 性能的有效方法,并显示了证据学习在多智能体框架中新角色。
引用
@article{arxiv.2511.00370,
title = {Who Can We Trust? Scope-Aware Video Moment Retrieval with Multi-Agent Conflict},
author = {Chaochen Wu and Guan Luo and Meiyun Zuo and Zhitao Fan},
journal= {arXiv preprint arXiv:2511.00370},
year = {2025}
}