语言模型引导的可解释视频动作推理
计算机视觉与模式识别
2024-04-03 v1
摘要
虽然神经网络在视频动作识别任务中表现出色,但其黑箱性质常常掩盖了对其决策过程的理解。最近的方法使用内在可解释模型以类似人类推理的方式分析视频动作。然而,这些模型通常在性能上不如其黑箱对应物。在这项工作中,我们提出了一个名为语言引导的可解释动作识别框架(LaIAR)。LaIAR利用语言模型的知识来增强视频模型的识别能力和可解释性。本质上,我们将理解视频模型决策的问题重新定义为对齐视频和语言模型的任务。利用语言模型捕获的逻辑推理,我们指导视频模型的训练。这种集成方法不仅提高了视频模型对不同领域的适应性,还提升了其整体性能。在两个复杂视频动作数据集Charades和CAD-120上的大量实验验证了LaIAR框架改进的性能和可解释性。LaIAR的代码可在https://github.com/NingWang2049/LaIAR获取。
引用
@article{arxiv.2404.01591,
title = {Language Model Guided Interpretable Video Action Reasoning},
author = {Ning Wang and Guangming Zhu and HS Li and Liang Zhang and Syed Afaq Ali Shah and Mohammed Bennamoun},
journal= {arXiv preprint arXiv:2404.01591},
year = {2024}
}
备注
Accepted by CVPR 2024