AffectSeek:基于模糊用户查询在长视频中代理化情感理解
计算机视觉与模式识别
2026-05-08 v1
摘要
现有的情感理解研究主要关注从图像、音频信号或预剪辑视频片段中识别情绪,情感证据已给定。这种被动且以片段为中心的设置未充分反映真实场景,用户常与长视频交互并通过自然语言查询表达需求。本文研究基于模糊用户查询的长视频情感理解 (VQAU),要求模型在模糊用户查询下定位情感时刻、预测情感类别、生成证据导向的论证。在此基础上,我们构建 VQAU-Bench,一个集成长视频、模糊情感查询、时间片注释、情感标签和论证解释的基准测试。VQAU-Bench 使我们能够系统评估语义-时间-情感对齐、情感时刻定位、情感分类和论证生成。为解决 VQAU 的多步骤推理挑战,我们进一步提出 AffectSeek,一个主动寻求、验证和解释长视频中情感时刻的代理框架。AffectSeek 将 VQAU 分解为意图解释、候选定位、片段验证、情感推理和论证生成,通过角色专用推理和跨阶段验证,逐步将模糊用户意图与长视频证据对齐。实验表明,现有的情感识别模型和单步视觉-语言模型在 VQAU 上仍具有挑战性,而 AffectSeek 提供了一个简单而有效的代理化长视频情感理解框架。
引用
@article{arxiv.2605.05640,
title = {AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries},
author = {Zhen Zhang and Yuhang Yang and Yunxiang Jiang and Yuhuan Lu and Haifeng Lu and Zheng Lian and Runhao Zeng and Xiping Hu},
journal= {arXiv preprint arXiv:2605.05640},
year = {2026}
}