StoryTR:基于心智理论推理的叙事中心视频时间检索
人工智能
2026-04-28 v1
摘要
当前的视频时刻检索擅长以动作为中心的任务,但在处理叙事内容时表现不佳。模型能够看到“正在发生什么”,但无法推理“为什么重要”。这种语义鸿沟源于缺乏心智理论(ToM):一种从表面观察中推断隐含意图、心理状态和叙事因果关系的认知能力。我们引入了StoryTR,第一个需要ToM推理的视频时刻检索基准,包含来自叙事性短视频(shorts/reels)的8100个样本。这些视频提供了一个理想的测试平台。其高信息密度通过微妙的跨模态线索编码意义。例如,一个眼神配合一声叹息所传达的语义与单独一个眼神完全不同。然而,仅有多模态感知是不够的;需要ToM来解码一个角色“微笑”可能实际上是在“隐藏敌意”。为教会模型这种推理能力,我们提出了一个智能体数据流水线,用于生成带有显式三层ToM链(意图解码、叙事推理、边界定位)的训练数据。实验揭示了推理差距的严重性:Gemini-3.0-Pro在StoryTR上仅达到0.53的平均IoU。然而,我们的7B Shorts-Moment模型,在ToM引导的数据上训练,相对于基线实现了+15.1%的相对IoU提升,表明叙事推理能力比参数规模更重要。
引用
@article{arxiv.2604.23198,
title = {StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning},
author = {Xuanyue Zhong and Yuqiang Xie and Guanqun Bi and Jiangping Yang and Guibin Chen},
journal= {arXiv preprint arXiv:2604.23198},
year = {2026}
}