视频大语言模型是否可以拒绝回答?面向可回答性的对齐框架
计算机视觉与模式识别
2025-07-08 v1 计算与语言
摘要
在深度学习的更广泛背景下,多模态大语言模型通过利用强大的大语言模型作为骨干,将不同模态对齐到语言空间,从而取得了显著的突破。这一进展的典型例证是视频大语言模型(Video-LLM)的发展。尽管提出了诸多方法来增强这些模型的视频理解能力,但它们主要是在来自视频内容直接生成的问答中进行训练。然而,在实际场景中,用户常常提出超出视频信息范围的问答,这凸显了 Video-LLM 需要评估问题相关性的需求。我们展示,即便是表现最佳的 Video-LLM 也无法拒绝不合适的问题——这并不一定是由于视频理解能力不足,而是因为它们未被训练以识别和拒绝此类问题。为此,我们提出了一种面向可回答性的对齐框架,使 Video-LLM 能够根据输入视频评估问题的相关性,并在问题超出视频范围时适当地拒绝回答。同时,我们设计了一套全面的评估指标体系,用于衡量模型在对齐前后的行为差异。此外,我们还构建了一个专为可回答性对齐而设计的数据集管道,利用现有的视频描述配对数据集实现。
引用
@article{arxiv.2507.04976,
title = {Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models},
author = {Eunseop Yoon and Hee Suk Yoon and Mark A. Hasegawa-Johnson and Chang D. Yoo},
journal= {arXiv preprint arXiv:2507.04976},
year = {2025}
}
备注
ICLR 2025