中文

面向视频摘要的不确定性感知与解码器对齐学习

计算机视觉与模式识别 2026-05-12 v1

摘要

视频摘要旨在通过选择最能反映人类偏好的时间重要片段子集,生成长视频的紧凑表示。由于标注具有强烈的主观性,且在评估过程中依赖于时间分割和基于背包问题的选择等离散解码过程,该任务本质上十分困难。现有大多数方法要么学习确定性的重要性分数而忽略了这些特征,要么采用复杂的生成模型从而增加训练和推理成本。本文提出 VASTSum,一个用于视频摘要的不确定性感知与解码器对齐学习框架,在单次前向传播模型中同时解决上述两个挑战。所提方法利用变分公式预测概率性的帧级重要性分数,从而能够显式建模由多标注者监督产生的不确定性。为了处理主观性问题,尤其是在二值标注下,我们采用一种监督策略,鼓励模型与合理的人类标注模式对齐,而非强制拟合单一共识目标。此外,我们引入了解码器对齐正则化,以提升基于背包问题的摘要选择的稳定性,降低对预测分数微小扰动的敏感性。我们在 SumMe 和 TVSum 基准上使用标准的基于排名的指标对该框架进行了评估。实验结果表明,在多个数据划分上均取得一致且具竞争力的 Kendall 和 Spearman 相关系数,证明在标注不一致时具有更好的鲁棒性,同时保持了高效的单次前向推理。这些结果表明,显式建模不确定性并将学习目标与解码阶段对齐,为确定性方法和基于扩散的视频摘要方法提供了一种有原则的替代方案。

关键词

引用

@article{arxiv.2605.09507,
  title  = {Uncertainty-Aware and Decoder-Aligned Learning for Video Summarization},
  author = {Omer Tariq and Syed Muhammad Raza and Jeongbae Son},
  journal= {arXiv preprint arXiv:2605.09507},
  year   = {2026}
}

备注

Accepted for presentation at the 2026 International Joint Conference on Neural Networks (IJCNN 2026)