利用多模态解释性注释提升基于模态特定数据集的视频解释
计算机视觉与模式识别
2025-04-16 v1 多媒体
摘要
我们考察了概念感知监督对多模态视频解释模型的影响,采用包含人类注释解释性概念的 MOByGaze 数据集。我们引入概念模态特定数据集(CMSDs),其由按注释概念模态(视觉、文本或音频)分类的数据子集组成。在两种早期融合和晚期融合方法中,使用 CMSDs 训练的模型均优于使用传统遗留训练方法的模型。值得注意的是,这种方法使晚期融合模型的性能接近早期融合模型。这凸显了在开发稳健、可解释的视频模型中模态特定注释的重要性,并推动了复杂视频分析中可解释多模态学习的发展。
引用
@article{arxiv.2504.11232,
title = {Leveraging multimodal explanatory annotations for video interpretation with Modality Specific Dataset},
author = {Elisa Ancarani and Julie Tores and Lucile Sassatelli and Rémy Sun and Hui-Yin Wu and Frédéric Precioso},
journal= {arXiv preprint arXiv:2504.11232},
year = {2025}
}
备注
6 pages, 8 Figures