利用基于 LLM 的多路径文本-视频对齐学习教学视频中的动作定位
计算机视觉与模式识别
2024-09-25 v1
摘要
由于标注的大规模训练视频可用性有限,学习定位教学视频中步骤的时序边界具有挑战性。最近的工作侧重于通过对比学习来学习视频片段与 ASR 转录的旁白文本之间的跨模态对齐。然而,这些方法未能考虑到对齐噪声,即视频中与教学任务无关的旁白以及旁白中不可靠的时间戳。为了应对这些挑战,本工作提出了一个新颖的训练框架。受大型语言模型(LLM)在步骤理解和文本摘要方面强大能力的启发,我们首先应用 LLM 过滤掉与任务无关的信息,并从旁白中总结与任务相关的步骤(LLM-steps)。为了进一步生成 LLM-steps 与视频之间可靠的伪匹配以进行训练,我们提出了多路径文本-视频对齐(MPTVA)策略。其核心思想是通过多条路径来衡量 LLM-steps 与视频之间的对齐,包括:(1)使用旁白时间戳的步骤-旁白-视频对齐,(2)基于其长期语义相似性的直接步骤到视频对齐,以及(3)专注于从一般视频领域学习到的短期细粒度语义相似性的直接步骤到视频对齐。来自不同路径的结果被融合以生成可靠的伪步骤-视频匹配。我们在各种任务和问题设置下进行了广泛的实验,以评估我们提出的方法。我们的方法在三个下游任务中超越了最先进的方法:步骤定位、步骤时序定位和旁白定位,分别提升了 5.9%、3.1% 和 2.8%。
引用
@article{arxiv.2409.16145,
title = {Learning to Localize Actions in Instructional Videos with LLM-Based Multi-Pathway Text-Video Alignment},
author = {Yuxiao Chen and Kai Li and Wentao Bao and Deep Patel and Yu Kong and Martin Renqiang Min and Dimitris N. Metaxas},
journal= {arXiv preprint arXiv:2409.16145},
year = {2024}
}
备注
Accepted to ECCV 2024