探索视频摘要任务中高效基础多模态模型
计算机视觉与模式识别
2024-10-11 v1 人工智能
摘要
基础模型能够根据提示指令和文本、音频或图像输入生成文本输出。最近,这些模型被组合用于执行视频摘要等任务。此类视频基础模型通过将每个模态特定模型的输出对齐到相同的嵌入空间来进行预训练。然后使用来自每个模型的嵌入作为输入,训练在所需指令集上微调的语言模型。在预训练期间,对每个模态进行对齐计算成本高昂,阻碍了对不同基础模态模型进行快速测试。微调期间,评估仅在领域内视频上进行,难以理解这些方法的通用性和数据效率。为缓解这些问题,我们提出了一种插即式视频语言模型。它直接将来自每个输入模态生成的文本输入到语言模型中,避免了预训练对齐开销。我们不采用微调而是利用少量样本指令适应策略。我们比较了插即式方法与基线调谐方法的性能与计算成本。最后,我们在域迁移期间探讨了每种方法的通用性,并就数据有限时有用的训练数据的洞见。通过这一分析,我们为在现实计算和数据限制下如何利用多模态基础模型以获得有效结果提供了实用见解。
引用
@article{arxiv.2410.07405,
title = {Exploring Efficient Foundational Multi-modal Models for Video Summarization},
author = {Karan Samel and Apoorva Beedu and Nitish Sontakke and Irfan Essa},
journal= {arXiv preprint arXiv:2410.07405},
year = {2024}
}
备注
11 pages, 4 figures