FACE-net: 基于事实校准与情感增强的检索增强情感视频字幕
计算机视觉与模式识别
2026-03-19 v1
摘要
情感视频字幕(EVC)是旨在用视频中表达的内在情感来描述事实内容的新兴任务。现有工作 perceived 全局情感线索,然后将其与视频内容组合以生成描述。然而,Insufficient 的事实与情感线索挖掘以及生成过程中的协调,使得其方法难以处理事实-情感偏置问题,即事实和情感要求在不同样本上的生成要求不同。为此,我们提出了一个基于 FActual Calibration 与 Emotion augmentation 的检索增强框架(FACE-net),通过统一架构协同挖掘事实-情感语义,为生成提供自适应且精确的指导,突破了在所有样本学习中事实-情感描述的妥协倾向。技术上,我们首先引入外部存储库并检索与视频内容最相关的句子以增强语义信息。随后,我们的事实校准通过不确定性估计模块将检索信息划分为主谓宾三元组,并通过视频内容对不同组件进行自我校准和交叉校准,以有效挖掘事实语义;而我们的渐进式视觉情感增强模块利用已校准的事实语义作为专家,与视频内容和情感词典交互,以生成视觉查询和候选情感,然后将其聚合以自适应方式增强每个事实语义的情感。此外,为缓解事实-情感偏置,我们设计了一个动态偏置调整路由模块以预测和调整样本的偏置程度。
引用
@article{arxiv.2603.17455,
title = {FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning},
author = {Weidong Chen and Cheng Ye and Zhendong Mao and Peipei Song and Xinyan Liu and Lei Zhang and Xiaojun Chang and Yongdong Zhang},
journal= {arXiv preprint arXiv:2603.17455},
year = {2026}
}
备注
Submitted to TPAMI. 16 pages, 9 figures