中文

任务驱动探索:解耦与任务间反馈用于联合时刻检索与高光检测

计算机视觉与模式识别 2024-05-09 v1 人工智能

摘要

视频时刻检索和高光检测是视频理解中两个非常有价值的任务,但直到最近它们才被联合研究。尽管现有研究最近取得了令人瞩目的进展,但它们主要遵循数据驱动的自底向上范式。这种范式忽略了任务特定和任务间的影响,导致模型性能不佳。在本文中,我们提出了一种新颖的任务驱动自顶向下框架TaskWeave,用于联合时刻检索和高光检测。该框架引入了一个任务解耦单元来捕获任务特定和公共表示。为了研究两个任务之间的相互作用,我们提出了一种任务间反馈机制,将一个任务的结果转换为引导掩码以辅助另一个任务。与现有方法不同,我们提出了一个任务相关的联合损失函数来优化模型。在QVHighlights、TVSum和Charades-STA数据集上的全面实验和深入消融研究证实了所提出框架的有效性和灵活性。代码可在https://github.com/EdenGabriel/TaskWeave获取。

关键词

引用

@article{arxiv.2404.09263,
  title  = {Task-Driven Exploration: Decoupling and Inter-Task Feedback for Joint Moment Retrieval and Highlight Detection},
  author = {Jin Yang and Ping Wei and Huan Li and Ziyang Ren},
  journal= {arXiv preprint arXiv:2404.09263},
  year   = {2024}
}