LogSTOP:用于匹配与检索的预测序列的时间得分
计算机视觉与模式识别
2025-10-09 v1 人工智能
摘要
神经模型如 YOLO 和 HuBERT 可用于检测视频和音频剪辑中各个帧的局部属性,如对象(“car”)和情绪(“angry”)。这些检测的可能性由 [0, 1] 范围内的得分表示。将这些得分提升到序列上的时间属性对于Several下游应用(如查询匹配(例如,“该语音剪辑中说话者最终是否听起来像快乐?”)和排序检索(例如,“检索前 5 个包含 10 秒场景的视频,其中在检测到车辆后检测到行人”))非常有用。本文我们正式化了在给定局部属性的可能噪声预测得分的情况下,为序列上的时间属性分配得分的 STOP(Scores for TempOral Properties)问题。我们提出了一种称为 LogSTOP 的评分函数,可高效地计算以线性时间逻辑表示的时间属性的得分。实验上,LogSTOP 结合 YOLO 和 HuBERT 在对象-视频和情感-语音上的查询匹配中,以至少 16% 的优势超过了大型视觉/音频语言模型和其他基于时间逻辑的基线。同样,在对象和视频中的动作的时间属性上的排序检索中,LogSTOP 结合 Grounding DINO 和 SlowR50 在零样本文本到视频检索基线上分别在平均精度和召回率上提升至少 19% 和 16%。
引用
@article{arxiv.2510.06512,
title = {LogSTOP: Temporal Scores over Prediction Sequences for Matching and Retrieval},
author = {Avishree Khare and Hideki Okamoto and Bardh Hoxha and Georgios Fainekos and Rajeev Alur},
journal= {arXiv preprint arXiv:2510.06512},
year = {2025}
}