多模态目标点在何处?基石模型识别情境相关时刻的能力
计算机视觉与模式识别
2026-03-06 v2 人工智能
计算与语言
摘要
基石模型被广泛应用于涉及按时间顺序排列的多模态事件语言生成的众多实际应用中。本文研究了模型识别视频中最重要子事件能力的问题,这是对 narrating 或总结多模态事件的基本前提。具体而言,我们聚焦于足球比赛,评估模型在区分比赛中重要与不重要子事件能力。为此,我们利用足球比赛精彩集锦中隐含的对重要性的人类偏好,构建了一个新数据集,且无需额外标注。使用我们的数据集,对比了多个最新进展的多模态模型,结果表明它们的表现并不甚远离随机水平。对模型进行分析时超越标准评估指标,揭示了它们倾向于依赖单一主导模态,以及在整合来自多个信息源时效果不佳。这凸显了处理多模态数据样本级异质性的模块化架构的重要性,以及最大化跨模态协同作用的互补训练程序的必要性。
引用
@article{arxiv.2601.16333,
title = {Where is the multimodal goal post? On the Ability of Foundation Models to Recognize Contextually Important Moments},
author = {Aditya K Surikuchi and Raquel Fernández and Sandro Pezzelle},
journal= {arXiv preprint arXiv:2601.16333},
year = {2026}
}